点击下方卡片,关注“具身智能之心”公众号


先抛一个问题:你觉得仿真会不会被世界模型取代?

前两周,我们组了一个仿真和世界模型的线上局。把国内做仿真合成数据硬核的一桌人请到一起:学术界、具身工业界、自驾都在。一整晚,我们探讨了六个问题:

  • 高质量的仿真数据,到底怎么定义?

  • 近两年,仿真数据迎来了哪些突破?

  • 世界模型是否改变了仿真数据的生产逻辑?仿真数据能不能成为数据金字塔的「第 1.5 层」?

  • 为了让生成的数据不违背物理规律,大模型端和工程端各自做了什么?

  • 「少量人类示范 + 大规模仿真扩增」,会不会成为默认的数据生产范式?

  • 新的训练范式,又会长成什么样?

周末攒了个仿真和世界模型的局,居然有人想干掉它。图1

聊到最后我们发现,这桌人其实分成了三个阵营,对「世界模型会不会干掉仿真」这个问题,给出了三种完全不同的答案。

而最扎心的依据,来自一个做了十年仿真的人。他居然盼着自己这一行早点被干掉。这句话先按下,我们在后面在展开。

下面一步步来。

01.

具身工业界:把视频模型当世界模型,是左脚踩右脚


现在很多做世界模型的人,都在偷换概念。

把「视频生成模型」直接当成了「世界模型」。而在工业界看来,这一步的概念偷换,是最大的误会。

群核科技的首席科学家唐睿,是本场圆桌里最早做渲染引擎的人。他对「视频模型能不能直接当世界模型用」这件事,态度很硬。

直接甩了八个字「左脚右脚,相辅相成」,然后给了一个我们觉得全场最好用的反例:钟摆。

你把一个球拉到眼睛边,松手,它荡过去、再荡回来。只要你没施力,它绝对打不到你的脸;可你稍微加一丁点力,它回来就撞上你了。


当你把视频模型往世界模型这个概念上迁移的时候,就会遇到这个问题。




为什么?因为视频,是把三维物理世界「坍塌」成了二维,唐老师说甚至只是「2.5 维」的画面。你看到了表象(appearance),但质量、摩擦力、刚体运动这些高维的物理信息,在坍塌的过程中消失了。

用抖音、YouTube 上的视频训出来的模型,画面足够惊艳,却缺了真实世界的传感器信号,也就没有能「对齐物理」的锚(grounding)。

简单来说,视频模型学会的是「世界长什么样」,并非「世界如何运转」。

他这句话基本给「仿真要被取代」的说法踩了脚刹车:


如果真有一个世界模型,能准确把高维信息解读出来、准确预测下一帧,那它就已经成了,咱们都不用做仿真、不用训练了。但事实,就是没有。




所以指望视频模型自己学会物理,在他看来等于「想着左脚踩右脚上天」。而仿真可以支持长程时空、还能无限 scale up 的「物理记忆」,短期内还无法被替代。

唐睿给的解法不是二选一,两者互为先验:把仿真系统放在中间当一架梯子,视频基模负责知识面和画面,仿真负责稳定物理记忆,顺着梯子往上爬,而不是指望谁单脚起飞。

周末攒了个仿真和世界模型的局,居然有人想干掉它。图2

最近群核科技新入选 ECCV 2026 的论文,正是这架「梯子」的工程落地:群核科技联合 Adobe、NVIDIA 等机构共同推出的真实感具身智能仿真器,开放超过 1.4 万个原生接口,能以照片级真实感同步输出深度图、语义分割等多模态训练数据。

如果说群核的答案是「两个路线如何融合」。那大晓机器人给的,则是「怎么从模型底层就把物理规律融合进去」。

这也正好回应了我们关心的问题:为了不让生成的数据违背物理规律,大模型端到底该做什么?

大晓的做法是从架构上改进。晋碧瑄提到,大晓摒弃了「用一个通用视频生成模型、再外挂一个控制模块」的拼接式架构。这种拼接最大的毛病是「表征错位」:负责画面的模块和负责动作的模块各说各话,生成数据时动作和环境对不上,物理交互的细节就容易失真。他们的解法是让两套系统共享一套注意力机制,从设计之初就把「理解、生成、预测」融合在一起。

在训练上,大晓把预训练拆成三个阶段:第一阶段用百万小时级的全量数据(含大量能表征物理规律的数据);第二阶段用万小时级、以人为中心的数据,让它学习人类的视角和任务的思维链;第三阶段才用真机加仿真数据,做状态和动作的联合训练。

周末攒了个仿真和世界模型的局,居然有人想干掉它。图3

大晓开悟世界模型(Kairos)

这个三阶段范式,其实回答了我们关心的另一个问题:「少量人类示范 + 大规模仿真扩增」会不会成为默认范式?大晓这条「以人为中心 + 仿真扩增」的路子,已经是这个范式相当完整的雏形了。

连一向低调的 51World,侯涛老师也补充了一句:在 AI 时代,仿真的地位并没有降低,而是在不断上升。从过去只做评测,到现在深度参与合成数据和闭环流程。

把这个阵营的话拢一拢,你会发现他们的立场高度一致:世界模型是方向,但不是替代品。真正靠谱的路,是融合。

听到这,你大概会觉得仿真挺安全。但下一桌人,就没这么客气了。

02.

学术界:数据的真实和位置,

仿真两头都不占


具身工业界忙着把仿真接进大 pipeline,学界却在追问一个更本分的问题:仿真数据,到底够不够资格?

上海科技大学的顾家远教授,做单目3D这类研究,对资产「真不真」敏感到骨子里。他说:设计的仿真资产未必反映具身智能应用所需的复杂度。


样板间一看就不是过日子的人设计的,他家不可能这么干净。




周末攒了个仿真和世界模型的局,居然有人想干掉它。图4

国外某公司经典的「干净」场景

模型训练上也会有问题。太干净、太理想的合成场景,模型很容易就认出「这是假的」,甚至干脆过拟合。

更棘手的是另一面:仿真数据里普遍缺失败案例。他提到 robotwin 里有个很经典的例子:抓可乐瓶,瓶子倒了,机器人从没见过这个姿态,于是怎么都抓不起来。


这个来源根本不是模型的好坏,而是这个数据压根就没有,你怎么刷都不可能 work。




一句话,在学界看来,仿真数据从根子上就带着点「假」。

北大的田洋,是合成数据集 InterData-A1 的作者。这是国内少数被拉去和闭源真机数据正面掰手腕、还被好几家机器人公司真正采用的仿真数据集。

按道理,他其实该给仿真站台。可他给仿真划的线,有些出乎我们的意料。

周末攒了个仿真和世界模型的局,居然有人想干掉它。图5

他认可仿真数据的价值,但只认它站在最前面那一段:仿真数据最该用在预训练(pretrain)阶段,当一种低成本、可控的数据增广,给模型增加基础的物理和视觉常识。至于微调(finetune),他的看法是:


最后一公里,都是为了真实的机器人去完成的。这时候再引入仿真,我反而感觉它没起到效果,就像绕了个远路,又走回去了。




这其实回答了我们最关心的问题:仿真数据能不能当数据金字塔的「第 1.5 层」?学界的答案基本是:能,但也就是 1.5 层。

它垫在真机数据下面打底、做数据增强是称职的,可越往上、越接近真机部署那一层,它的位置就越尴尬。

省不到最真,也站不到最后。这就是学界眼里的仿真:一个价值明确、但注定「过渡性」的角色。

到这儿,仿真的处境已经从「不可替代」降了一档。

但真正把温度降到最低的,是圆桌上唯一一个自驾行业的专家。

03.

自驾行业:仿真的价值会持续走低


白宇材是这场圆桌里唯一还在深耕自动驾驶的专家。

我们特意把他请来,是想让具身听听「过来人」的经验。自驾比具身早发展几年,它踩过的坑,对具身有很强的借鉴意义。

他上来就给了一句不留情面的判断:在自驾圈子,合成数据的价值被反复质疑,原因就一个:真实数据已经足够便宜了。


你做合成数据,会反复被挑战的就是这个东西比真实数据到底好在哪。




他把自驾对仿真的需求分成三个部分:

  • 冷启动阶段数据少,仿真用得上,这时候「长得像、sim-to-real gap 小」就是质量的核心;

  • 可一旦到了数据爬坡期,几万、几十万、几百万条真实数据低成本堆量,「其实不太需要仿真数据」;

  • 非得等遇到瓶颈、开始做极端场景(corner case)了,仿真才被重新想起来。

简单来说,仿真不是一直有用,而是在实车无法cover的时候才有用。它的价值不是恒定的,而是随真实数据的成本反向浮动:真实数据越便宜,仿真就越边缘。

周末攒了个仿真和世界模型的局,居然有人想干掉它。图6

自动驾驶闭环仿真示例

不过他也不是一味看空。这两年基于纯生成类的方法,也让他重新思考自动驾驶3DGS仿真的必要性。

既然生成已经足够好,我给layout就能拿到对应的场景,那我为什么还要费劲去做高斯重建?他现在的落地心法是一句很实用的话:模型负责上限,规则负责下限。

前不久做出海项目、要过欧盟法规,两周内得做出 5000 帧很 corner 的海外场景(比如某种特定的自行车灯),就靠生成式逻辑快速出数据、再用规则兜住底线,很快交付了。

自驾过来人经验,对具身是个不太中听的提醒:别把仿真当成永久的护城河。

当真实数据的采集成本一路下探,仿真的成本效应,会第一个松动。

而白宇材自己也判断,自驾「要不就是做完了」,下一波人多半会涌向具身。

三个阵营讲完,仿真的处境像是被一路降了温:工业界说它不可替代,学界说它是过渡,自驾说它会边缘化。

那么,回到最开始那个问题:传统物理仿真,到底会不会被干掉?


写在最后


现在可以聊聊我们的看法了。

那个做了十年仿真、却盼着仿真被干掉的人,是顾家远教授。聊到仿真的终极形态时,他把票投给了数据驱动。他更想看到的结局是,视频生成模型靠数据积累转起飞轮,最后达到的上限,超过传统物理仿真。

他甚至半开玩笑:如果我们这条路做不下去了,那就去开发游戏吧。他还引用王贺的说法佐证这条路的尽头:世界模型生成数据这件事,本质是「鸡生蛋、蛋生鸡」,当你攒够数据训练出一个能用的世界模型,你手里基本也就有了足够的数据,可以直接去训策略。

这就是业内对仿真最真实的看法。

把三个阵营的答案摆到一起看,你会发现一件事:他们口径完全不同,过渡、梯子、边缘化,但箭头都隐隐指向同一个方向。

传统物理仿真那种「你想造仿真数据就绕不开我」的独占地位,快站不住脚了。

我们的判断是:拉长到三五年看,路线之争的终点,大概率是生成式的这条路,一点点蚕食、甚至接管传统物理仿真今天占据的位置。 顾家远盼的那一天,未必不会到来。

但这也并不是说仿真就没有未来,毕竟一些独角兽的估值已经到了20亿美元,资本是不会盲目站队的。

所以真正在发生的,从来不是非黑即白的「替代」,而是仿真被重新定位、,两条路线在加速融合。

写到这里你大概能体会到,这一晚的圆桌交流,底色一点都不悲观。一个方向,能被自己人挑剔、较真到这个份上,其实也说明它走过了被概念吹捧的阶段,进了真刀真枪打磨的黄金期。

这也是我们特别想把这样一场圆桌完整记下来的原因。

当下的具身和物理AI,能聊的东西太多,但能真正讲透的人,不过。

很多硬核的判断,就是在这样一桌人的你来我往里闪一下,然后散场,可能无人在意。

我们想做那个接住它的人,也想找到更多和我们志同道合的朋友。

周末攒了个仿真和世界模型的局,居然有人想干掉它。图7


END

 推荐阅读 :