}


投资人广撒网式布局,但真正的全域沉浸式生成,还少之又少。

作者|Cynthia

编辑|郑玄

2024 年 8 月 27 日,DOOM 里的一声枪响,在 2026 年年中的资本市场,听到了震耳欲聋的回响。

这一天,一段《DOOM》的游戏画面出现在 Google Research、Google DeepMind 和特拉维夫大学研究团队公布的演示里。

棕红色的墙壁,幽暗的走廊,像素化的枪口,玩家移动,怪物出现。然后,玩家按下键盘,枪响了。

如果不去细看,这段演示与三十年来无数次《DOOM》游戏录像没有任何本质区别。

变化发生在屏幕背后:那里没有一个传统游戏引擎,玩家扣动扳机之后,会出现什么画面,全是靠模型在毫秒内自行推演出的。

于是,过去互联网时代短视频 vs 直播的叙事,在 AI 视频生成赛道再次重演。

但很可惜,由于成本以及谷歌内部的诸多考虑,那声枪响,很快被离线生成视频带来的掌声盖住。此后一年里,行业的聚光灯逐渐集中到了 Sora、可灵、Seedance 这样的离线生成模型玩家之上。围绕分辨率、镜头语言、人物一致性和生成时长,整个行业都在研究如何把十秒钟的视频做得更像电影。

但枪声并没有消失,穿行了整整两年,在今年年中的资本市场,实时视频生成终于迎来了史无前例的爆发。

01

一张拥挤的牌桌,与行业的第三条路线

2026 年 8 月 13 日,Anthropic 被曝:正洽谈以约 60 亿美元收购实时视频生成的初创公司 Decart。


消息如涟漪般扩散,层层传导共振。从美国到中国,从创业到投资,从内容社区到世界模型,实时生成视频成了行业的当红炸子鸡:2026 年过去的七个月里,融资消息几乎以周为单位发生,从 Runway 到 World Labs;从 Decart 到 Odyssey,单轮融资两三亿美金,已经成为行业常态。


在美国,大量产业投资人会选择多头下注

桌上筹码越堆越高,但比金额更值得玩味的是出资方名单。英伟达、AMD 同时出现在 World Labs 与 Runway 的股东席上,Adobe 押注 Runway 与 Decart,亚马逊、自动驾驶玩家站在 Odyssey 身后,丰田、红杉、Benchmark 围在 Decart 桌边。

一张拥挤的牌桌上,坐满了焦虑的投资人,野心勃勃的创业者,新一代技术极客,以及翘首以待的游戏、直播、教育乃至自动驾驶与具身智能行业的玩家。

他们都在等一个信号:门什么时候打开,又将被谁打开。

而接下来最关键的事情,无非是桌面上的三派玩家,他们更愿意押注在哪一个。

字节跳动的 Seedance、快手的可灵、生数科技的 Vidu 为代表的第一类玩家,将替代实拍、剪辑与特效卷到极致后,便开始不断增加视频的清晰度与时长。但这条路只改变了生产方式,视频依然是一段被提前做好、供人观看的成品,观众永远坐在屏幕外面。

第二条路上的玩家试图打破这面墙。World Labs、Odyssey,还有国内的爱诗科技、智象未来,都在往实时流式生成的方向走。它们要做的是一个可以实时演化的数字世界:你可以操控视角、改变环境、用指令让世界长出新的地貌。它把人从观众变成了玩家,但仍需要用户通过键盘、鼠标和 Prompt 驱动内容生成,进入的门槛依然还在。

很快,在第二条路线的基础之上,又分化出了第三条路线:他们管自己叫做全域沉浸式生成,即 Immersive;这个词也恰好是《头号玩家》中绿洲(OASIS)全称的第四个单词。

代表玩家是形界智能的 Rise 系列。它的核心逻辑是:交互的终极形态,不是人去适应模型,而是模型来适应人。用户不需要学习指令,只要通过摄像头,用最自然的动作、表情、姿态,就能进入和影响这个视频中的世界与交互。这个过程中,用户不再需要学习如何发出 AI 能理解的指令,世界开始主动理解用户本身。

路线没有绝对的对错:第一条路线的目标是更好的生产工具,第二条路线通往的是实时互动的数字世界,第三条路线的野心则是成为更低门槛的世界入口。

每条技术路线背后都是一整套关于时间、成本和模型架构的精密算术。

02

一位典型技术型创始人,

与一个仍被低估的蓝海

技术路线仍未形成共识,资本已经提前冲了进来。

注意到形界智能,不仅因为它是全域沉浸式生成赛道上为数不多的玩家,也因为它的融资进度。这家成立于 2026 年 5 月的创业公司,成立首月便完成了数千万元首轮融资。截至今天,成立才过去不到 3 个月,排队入场的投资人就已经等到了两轮乃至三轮后。

其中,已经在牌桌上的投资人们看好的逻辑不尽相同。

有人看中的是全域沉浸式生成在内容与游戏方面的潜力。

早期,国内抖音、快手在内的短视频社区,虽然起家靠短视频,走的是内容社区加广告的商业模式;但有了直播,不仅带来了新的流量入口与粉丝粘性,也通过带货、打赏、PK 等玩法带来了低成本、高效、稳定的商业转化。

AI 视频的演进,正在复刻同样的路径:当离线生成的画质、时长、一致性一步步逼近商业化的临界点,实时就成了下一个必须拿下的要塞。也只有实时,才能诞生更紧密的互动,从而生长出比纯内容生产更广阔的商业模式。

也有人看中的是公司创始人的身份背景以及企业的技术积累。

一方面,形界智能的 CEO 王裕鑫,中科大博士毕业,五年里发了二十多篇顶会论文的学术经历,是当下最标准的技术型创始人画像。另一方面,王裕鑫的上一段工作经历中,作为元石科技 007 号员工,他曾牵头组建国内较早一批 MoE 架构大模型预训练团队,一度被海外知名 AI 技术评论人 Simon Willison(Django 联合创始人)评选为 2025 年与 DeepSeek、MiniMax、智谱、千问和 Kimi 并列的中国 Top6 大模型团队。

所以一定程度上,这是一个已经在大模型战场上证明过自己的技术团队,一头扎进了更新的战场。

而几年的创业公司经历,也让他比同龄的创始人多了几样东西:对产品工程落地的体感,和对技术周期的判断力,以及与投资人、客户打交道的经验。

于是,2026 年初看到沉浸式视频生成的机遇之后,几乎没有犹豫,在当年 5 月,王裕鑫就带领一群中科大院长优秀奖获得者、华为天才少年、字节 Top Seed、阿里星的顶尖技术人才成立了形界智能,并在当月拿下数千万元天使轮融资。

团队的两项成果 Stream-R1 与 Stream-T1 也在同期直接登顶 Hugging Face 每日论文榜前二,连 Hugging Face 联合创始人与知名 AI 研究者 AK 都公开推荐。

这两篇论文踩中了行业的两个痛点:Stream-R1 从训练侧改造了流式视频的蒸馏过程,让奖励信号参与不同 rollout、不同帧和空间区域的训练权重分配;Stream-T1 则转向推理侧,通过候选搜索、历史噪声传播和记忆管理探索流式视频的 Test-Time Scaling。两者分别从训练和推理两端提高流式生成质量。

在此基础上,形界智能更关注的问题是如何让每个人以更低的交互成本进入一个世界。在王裕鑫看来,要实现这个目标,技术上还需翻过三座大山。

第一,视频流原生输入:视频不用经过独立理解模型再转换成控制指令,可以端到端地实现视频输入视频输出,以实现极低的交互延迟。

第二,理解与生成联合建模:用户输入与生成输出可以在同一时序内共同建模,让用户可以直接通过摄像头连续输入来影响视频模型生成。

第三,统一 Scaling:理解与生成能够在同一模型范式下共同 Scaling,以实现生成、理解的同时智能涌现。

基于这 3 个标准,不久后,2026 年 7 月 17 日-20 日的上海 WAIC 期间,形界智能正式发布了「Era」系列首个面向社交场景的互动视频生成模型——Genesis。也正是这一次更大范围的受众传播,彻底让形界智能坐上了资本与同行竞争的牌桌。


这是一个全双工的视频生成模型:能随时打断,能感知摄像头输入,能对观众的动作实时做出反应。实时理解 + 实时生成 + 实时响应的闭环第一次跑通,类人交互的体验也从概念变成了可以上手的 Demo。

展会三天,Genesis 的体验队列从没断过,累计体验时长超 10 小时,等待名单里躺了一百多个意向团队。

但 Genesis 只是起点,在这之后不到一个月时间,形界智能又发布「Era」系列第二个全域沉浸式生成基础模型Rise,以每秒一分钱的定价以及 500 毫秒的无感延迟,让用户实现了低时延的开放世界自由探索

回顾历史,形界智能这种低成本进入世界+社交+开放场景自由探索的 milestone,很容易让人想起 2018 年上映的电影《头号玩家》:一个戴上头显就能进入的虚拟世界,人人可以在里面行动、社交、创造。

但类似的故事,市场在上一波元宇宙浪潮中已经听得够多。即便超级巨头 Meta 举公司之力投入,也并未让其摆脱极客玩具的命运。

那么,在 AI 时代,形界智能为什么能成为例外?成本、效率,以及背后的模型架构,是其中关键。

03

一个每秒一分钱的端到端架构,

与一个10B的模型

最近一个月,王裕鑫出门见人时,总会带着电脑,然后随时打开一个类似赛车游戏的画面,盛情邀请对方参与体验。

只要用户站在电脑摄像头前,摆出开赛车的动作,画面中的赛车就会跟着用户的动作,一路转弯、漂移、加速、直行。过程中,用户手中的虚拟方向盘可以是个手机,可以是一支笔,甚至可以双手虚空。

比较惊喜的是,在赛车这样一个高速运转的场景中,用户的动作几乎被实时捕捉,然后映射在画面之上,整个过程流畅得像一段提前渲染好的游戏 CG。这对于一个多模态大模型来说,是几乎难以想象的突破。(模型体验入口可以点击文末「阅读原文」字样。)

借助这个演示,我们很容易理解它与前几代行业路线的区别。

首先是架构。在形界智能之前,行业里的实时视频生成,一般会把理解用户动作和生成新画面拆成两个独立模型:摄像头采集画面,先传给理解模型,把动作翻译成文字或状态指令,再把指令喂给生成模型,输出新的视频,但文本存在大量一句话对应多种结果的多对多映射之外,一来一回,中间的翻译损耗、通信开销、串行等待,把延迟牢牢钉在了 4 秒以上。然而交互的本质是反馈,反馈一旦超过人类感知的阈值,沉浸感就会碎得一干二净。

因此,在形界智能看来,去掉翻译与串行,以 Native Interactive Representation Scaling 方式端到端地把理解和生成放进同一个模型里,才是真正做到沉浸式视频实时生成的唯一解法。

这张图展示了 Rise 这一实时沉浸式视频生成基础模型的运行流程。


以赛车游戏场景作为示例。提示词会告知模型需要依据输入视频里的方向盘动作完成赛车操控。然后系统会接收持续的视频流输入,将摄像头采集的真实视觉观测切分为连续的 500 毫秒视频片段,连同定义任务目标的系统提示词一同送入基础模型。

在每一个 500 毫秒时间窗口内,模型同时接收当前新的摄像头视频片段,以及从上一轮推理继承而来的噪声块。模型基于这份继承得到的隐状态继续开展扩散推理,一方面将该中间隐表征解码,生成可供外部使用的像素级干净视频片段作为最终输出,另一方面保留这份原始的部分去噪隐张量,将其作为噪声块回传,成为下一个 500 毫秒推理窗口的输入之一。

基于这个架构,在Pre-training 阶段,Rise 会同时学习视频理解、视频生成,以及理解与生成的联合建模任务,从而让精准的用户行为理解能力和视频生成成为可能。Post-training 阶段,Rise 仅用300 小时的赛车数据,就实现了逼真的互动体验效果。

从最终的用户体验来说,这套设计换来了三个结果

一是用户可以通过摄像头这种最直接的交互语言,直接影响视频生成结果。

二是借助 10B 级参数规模,将时延压低至接近无感的水平。形界智能是目前国内第一家,真正体感延时控制在 500 毫秒的玩家。

三是推理效率指数级上升,算力成本从传统两段式方案每秒 7 毛钱,被压到了定价每秒 1 分钱,模型供应商还仍有利润空间。

1 分钱定价是什么概念?企业做一场两小时的 AI 直播互动,过去要花五千到八千元的成本,现在只需要 72 元。而且随着架构迭代与芯片适配,成本还有继续下探的空间。

再然后,模型进一步被用在情感陪伴、教育、乃至具身模型训练数据采集等各种场景,剩下的就只是时间问题。

04

沉浸式视频生成,

一个还不是世界模型的新世界入口

采访中,我们问了王裕鑫一个问题,从 Genesis 到 Rise,形界智能做的很像世界模型在做的事情,为什么不干脆把自己放在世界模型的赛道?

两分钟时间里,他列举了包括但不限于:物理仿真、记忆、多人参与、画面精细程度在内一连串当下阶段产品与真正世界模型的差距。

做个类比的话,当前的技术,还处在 GPT3 的前夜。但这并不意味着当下的产品是一个半成品。

因为至少对直播、陪伴、教育这样的行业来说,我们这一代人,或许正在亲眼见证数字内容从被观看的对象变成可进入的空间的历史性跨越:屏幕那边不再是别人拍好的故事,而是一个等着你走进去的世界。

终局尚未到来,但下一个时代的入口已经清晰可见。

*头图来源:AI 生成

本文为极客公园原创文章,转载请联系极客君微信 geekparkGO

极客一问

AI 视频的终极竞争,

是画质还是实时交互?