中国世界模型之战:资本下注的四类团队,谁真正接近 Physical AI 版 DeepSeek?
高校实验室、自动驾驶老兵、视频生成团队和大模型创业者同时涌向世界模型。真正的分水岭不是融资速度或标签,而是谁能取得真实系统的决策权,把高因果密度数据、跨本体适配、在线评测与部署反馈压进一条边际成本持续下降的学习曲线。
要点速览
- “世界模型”不是一种同质产品,而是一条决策权阶梯:有的模型只生成训练数据,有的学习表征或评估候选策略,有的提出动作,少数系统才直接进入实时闭环。模型拥有多大决策权,就必须接受多严格的延迟、校准、安全与真实任务验证。
- 决定数据价值的不是小时数,而是因果密度:能否同时看到动作前状态、实际动作、动作后果、失败原因和人工接管。互联网视频提供规模,产品交互提供偏好,UMI 与遥操作提供动作监督,真实部署提供结果与失败;它们不能按“数据量”简单相加。
- 跨本体不是把同一组动作 token 发给不同机器人。Open X-Embodiment、RDT2、π0.5 和潜在动作研究分别尝试标准化数据、统一末端执行器、异构协同训练和学习共享任务接口;真正的商业指标是接入第二、第三种本体时,采数、标定、安全验证和驻场工时是否下降。
- 四类团队的起点各不相同:高校派强在研究密度,自动驾驶派强在闭环工程,视频派强在规模化预训练与产品分发,大模型和大厂派强在算力、Infra 与生态。起点不是终局,胜负取决于团队能否补齐自己最不擅长、却决定真实部署的那一环。
- Physical AI 版 DeepSeek 的核心类比不是“用更少钱训练一个大模型”,而是算法、数据与系统协同后改变效率曲线:更少真机数据完成新任务,更少示范接入新本体,更少人工接管维持运行,更少现场工程复制到新客户,并且这些改善能被外部复现。
世界模型在 2026 年成为一级市场最拥挤的技术词之一,也成为最容易被重新包装的标签。机器人公司、视频生成公司、3D 团队、游戏模型项目和大模型创业者都能讲出一套“理解世界”的叙事,但它们学习的状态、使用的动作、承担的实时性、拥有的决策权限和面向的客户完全不同。真正值得研究的不是谁最像“世界模型公司”,而是谁能把预测变成可归因的行动收益:模型是否改变动作选择,失败是否回到训练系统,新任务与新本体的适配成本是否持续下降。
从四类资本下注,走向决策权、数据质量与成本曲线的同一场考试
八个章节先还原四类创业谱系,再沿着控制权阶梯、数据因果密度、跨本体复用和部署反馈四条主线,判断世界模型究竟是内容引擎、训练工具、策略评估器,还是能够承担真实行动结果的基础系统。
01|热词比技术先收敛:世界模型为何突然成为资本共同语言
2026 年上半年,世界模型从研究议题迅速变成一级市场的共同搜索词。基金重新梳理项目库,机器人公司被重新估值,原本做视频生成、3D 重建或游戏环境的团队也开始用世界模型描述自己。需求并不是来自一个已经确定的产品类别,而是来自一种 FOMO:如果物理世界会诞生下一家基础模型平台,投资机构不愿缺席最早一轮。
问题在于,世界模型没有形成统一产业口径。对视频团队,它可能是能够连续生成并接受控制的视觉环境;对机器人团队,它是预测动作后果的状态转移模型;对 3D 团队,它是可查询、可编辑的空间状态;对大模型团队,它又是持续学习和理解现实的下一阶段。共同标签扩大了可比公司池,也掩盖了训练对象、产品接口和商业模式的根本差异。
最需要拆开的不是二维、三维还是隐空间,而是模型在真实系统里拥有多大决策权。Cosmos 一类世界基础模型可以生成边界场景和训练素材;V-JEPA 2-AC 一类潜空间模型可以支持目标条件规划;WorldEval 把世界模型用作策略排序和安全筛选;DreamZero、GigaWorld-Policy 与 Motubrain 则试图直接输出闭环动作。这四类产品的客户、时延预算、事故责任和收入模型都不相同,不能放在一张“视频质量”榜单里估值。
资本实际押注的是四种人才与能力迁移。高校实验室把论文、导师网络和年轻研究者带进创业公司;自动驾驶核心成员把真实数据、闭环训练和系统交付带入机器人;视频生成团队把大规模预训练、生成产品和用户行为数据带入动态世界;基础模型与大厂团队则把算力、Infra、组织能力和多模态底座向物理系统外延。
四种能力迁移只决定初始速度,不决定终局位置。高校团队最终会撞上工程与交付瓶颈,自动驾驶团队会撞上接触动力学和多本体,视频团队会撞上动作监督与真实反馈,大厂团队会撞上聚焦和决策速度。更可靠的研究方法是追踪“瓶颈迁移”:公司每解决一个问题后,下一个限制增长的环节是什么,它是否已在组织、数据预算和产品路线中被提前安排。
因此,世界模型公司的核心资产可以压缩成一个乘法式判断:可用反馈权 × 数据因果密度 × 实验周转速度。没有反馈权,客户现场的失败无法回流;因果密度低,模型只看到相关性而不知道哪个动作造成结果;实验速度慢,任何算法优势都会在长周期真机验证中被消耗。三项中任何一项接近零,模型规模和融资额都很难形成持续复利。
市场上流传着一组关于规模、融资、估值和公司数量的合计数字,但缺少可复核的样本表、统计定义与逐笔交易依据。因此可以确认“资本显著涌入、公司密集出现”的结构性趋势,却不能把这些合计值直接当作市场事实。公司判断仍需区分论文、正式公告、媒体报道与未证实传闻。
顶刊成果、导师谱系、年轻人才密度;短板通常是组织、交付与全职化。
真实数据飞轮、感知控制栈、工程管理;需要证明方法能跨越道路到通用操作。
海量视觉数据、生成基模和用户产品;需要补上动作、几何、接触和控制接口。
算力、Infra、多模态底座和生态;需要找到可持续真实场景与更快决策机制。
02|高校派:研究密度可以换来起跑速度,不能替代公司成熟度
高校实验室正在从技术供给端变成创业组织端。逆矩阵、LiberAI 和厘清智能分别代表三种典型切口:下一物理状态预测、跨本体动作基础模型,以及 Real-to-Sim-to-Real 的数据与物理训练系统。它们的共同优势是研究问题足够前沿、人才聚集速度快、导师与实验室网络能够在早期提供稀缺研究资源。
逆矩阵围绕 Physis 推进“下一物理状态预测”,把 RGB-D、点云、力触觉、视频和动作压入统一物理隐空间。公开技术说明里最值得关注的不是多模态数量,而是它明确把当前隐状态 S0、动作与下一状态转移写进因果结构,并计划用视频、物理状态量和 motion translation 等不同解码器检验同一表征。如果一个隐空间只能重建漂亮视频、却不能帮助策略比较动作后果,它仍然是压缩器;如果多个任务解码器都能从同一状态获益,才开始出现基础模型的复用证据。北京市政府与智源材料能够确认模型发布与融资进展,但模型权重、外部真机复现和客户部署仍有限。
LiberAI 的公开技术锚点来自 RDT 系列。RDT2 披露了超过 1 万小时、覆盖 100 多个室内场景的 UMI 人类操作数据,用残差向量量化把 0.8 秒、30 Hz 的连续双手动作压缩为 27 个 token,再以 flow matching 动作专家连接语言、视觉与连续控制。它选择用统一夹爪和腕部相机缩小人机与跨本体差异,这是一种“先统一接口,再扩大数据”的工程路线,而不是宣称任意本体天然同构。官方也明确排除了接触水、热源、五指灵巧操作和高耗材任务,这些边界恰好说明跨本体泛化必须与末端能力边界一起理解。
RDT2 的真正商业指标不是 Demo 覆盖多少物体,而是接入第二、第三种机械臂时的完整账单:法兰与 TCP 标定需要多久,安全参数是否重设,新增场景需要多少 UMI 或真机数据,微调与验收由谁完成。若统一夹爪能让这组成本持续下降,它会成为数据标准和模型接口;若每换末端执行器就重新采集大部分数据,所谓跨本体主要是硬件约束下的局部迁移。关于团队规模与最新估值,公开报道存在不同口径,公司尚未统一披露。
厘清智能则把数据采集、物理表征、可微物理引擎、强化学习和轮臂部署放入同一系统。其核心不是单一世界模型,而是让真实操作生成可校准仿真,策略在仿真中训练,再由真机误差反向修正模型。公司融资已获政府和产业媒体披露,但百万小时数据、复杂材料任务的成功率和付费部署仍属于未来验证项。
厘清智能的路线揭示了一个经常被忽略的壁垒:世界模型不一定通过更大的参数量形成复利,也可能通过更快的校准闭环形成复利。如果真实误差能够自动识别仿真中最不可信的材料、接触和执行器参数,并把下一轮真机试验预算集中到这些区域,那么每一次部署都在缩小仿真—现实差距;如果仍靠工程师手工调参,系统只是昂贵的项目工具链。
高校派的组织风险与技术优势来自同一来源:学生和实验室成员能快速形成高密度团队,却也面临学业、全职承诺、股权分配、非师门人才融入和工程管理问题。判断这类公司时,不能只研究导师谱系,还要看核心成员是否全职、研究代码和数据权利能否转成公司资产、模型是否有稳定版本节奏,以及销售、数据运营和现场交付是否形成独立负责人。
更深一层的问题是“研究复利是否能变成公司复利”。论文领先可以吸引人才和融资,但若数据仍依赖实验室、本体由合作方控制、客户现场又不能回传失败,核心知识会停留在个人和项目中。公司必须拥有可重复的数采协议、评测集、训练配方和部署日志,才能把一届学生的创新沉淀为下一届团队可复用的生产资料。
| 样本 | 主要技术切口 | 当前强证据 | 下一项决定性验证 |
|---|---|---|---|
| 逆矩阵 / Physis | 多模态隐状态 + 动作条件下一状态 | 公开架构、研究机构与政府发布 | 同一隐状态对策略、物理量与视频任务的增益;外部复现 |
| LiberAI / RDT2 | 统一 UMI 接口 + 跨本体动作模型 | 1 万小时 UMI、开源模型与部署说明 | 新末端 / 新本体的采数、标定、微调与验收总成本 |
| 厘清智能 | Real-to-Sim-to-Real + 可微物理 | 闭环方法论、数采入口与产业资本 | 误差能否自动驱动仿真校准;复杂材质任务与客户验收 |
03|自动驾驶派:数据飞轮与系统工程能否跨越道路边界
自动驾驶创业潮留下了一批理解数据闭环、实时系统和大规模工程协作的技术负责人。进入机器人后,他们不再只解决道路上的感知与规划,而要面对接触、灵巧操作、开放物体、多形态本体和更稀疏的任务数据。优势是真实工程经验,风险是把道路场景中已经成立的方法论机械复制到完全不同的物理分布。
道路系统的数据原子通常是时间同步、传感器标定完整的驾驶片段,失败信号来自接管、碰撞风险或规则违背;机器人系统的数据原子必须进一步包含任务目标、对象初态、连续动作、接触状态、结果、人工介入和恢复路径。同样一小时数据,前者可能包含连续可用的道路监督,后者却可能只有少量关键接触事件。机器人飞轮的核心不是录像时长,而是每小时产生多少个可归因的“动作—后果—恢复”样本。
星海图的核心叙事是“一脑多形”:不把价值锁死在单一本体,而是用统一模型、数据和训练系统服务多种机器人。这个思路与自动驾驶的数据飞轮相似——部署产生数据,数据改善模型,模型扩大部署——但机器人任务比道路驾驶更碎片化,动作空间和硬件差异也更大。真正需要验证的是每增加一种本体或任务,适配成本是否下降,而不是产品数量是否增加。
“一脑多形”不能只用共享视觉语言骨干来证明。真正需要共享的是任务进度、可供性、失败语义和恢复知识;真正应该隔离的是不同本体的运动学、力矩边界、末端能力和安全控制。过度统一会让模型忽略硬件差异,过度分离又无法产生数据复利。更合理的架构通常是共享世界与任务表征,再用本体条件化动作头、约束层和安全控制器承接差异。
破壳机器人代表另一种判断:只做世界模型而不承担本体与场景,可能无法获得足够高质量的动作—结果数据,因此选择家庭具身作为长期目标。关于创始人股份处置、估值和多轮融资的说法尚缺公司或交易方正式文件,不能据此判断公司价值。可以确认的战略命题是:物理基础模型必须与真实本体、失败数据和长期任务发生关系。
极佳视界从智能驾驶视觉与感知背景进入 World–Action Model 和通用机器人。GigaWorld-Policy 把动作预测与动作条件未来视频联合训练,用因果结构阻止未来视频 token 反向泄露给动作 token,并允许部署时关闭完整视频生成。论文报告相较 Motus 获得 9 倍推理加速和 7% 任务成功率提升;这项设计的重要意义不是某个榜单分数,而是把“训练时用世界监督、运行时只支付动作成本”变成可工程化选择。相关结果仍主要来自团队论文,需继续等待独立真机复现。
全球路线也给出了更高的参照:DreamZero 报告用 14B 视频扩散骨干实现 7 Hz 闭环控制,并用少量新本体数据进行适配。这表明视频世界模型已经不必停留在离线生成,但也暴露了产业门槛——实时性来自模型蒸馏、缓存、异步执行和系统优化共同作用,不是换一个模型名字就会自动获得。对中国团队而言,推理栈、动作平滑、故障恢复和边缘部署能力与模型架构同样重要。
流形空间强调从“看见世界”走向“推演世界”,把世界模型连接机器人、XR 和开放数字环境。产业经验有利于定义产品接口,却不能自动解决基础模型问题。这里的关键证据是预测是否能改变动作选择、降低真实试错,并在不同环境中保持校准,而不是是否生成了具有物理观感的演示视频。
自动驾驶派最终要证明的不是能否搭出数据平台,而是能否重写数据平台的目标函数:从“发现道路长尾”改为“发现动作因果与恢复缺口”,从统一车辆 ODD 改为显式记录本体能力边界,从里程与接管率改为任务成功率、无人工恢复率和单位现场工时。只有指标系统完成迁移,经验才真正完成迁移。
连续采集道路分布与长尾场景
接管、碰撞风险与低置信片段
感知—预测—规划共享数据规范
回放、仿真、灰度和版本治理
- ✓长尾难例挖掘
- ✓影子模式评测
- ✓数据与模型版本治理
- ✓发布—回滚机制
- ↺连续控制与接触动作
- ↺力、形变和遮挡
- ↺本体能力与安全边界
- ↺任务级客户验收
仿真、受控现场再到生产任务
动作—状态—结果—人工接管
共享表征同时保留本体能力边界
恢复测试、客户验收和版本发布
04|视频派:最大的视觉数据入口,距离物理行动还有四次转换
视频可能是世界模型最丰富的预训练燃料,因为它同时包含外观、运动、视角变化和大量隐含交互。它也可能成为最容易被高估的入口:画面连续不等于对象持久,视觉逼真不等于受动作控制,统计运动不等于接触动力学,能够生成未来更不等于能够实时驱动机器人。
视频数据的根本缺口是干预不可见。普通视频能告诉模型“之后发生了什么”,却经常不知道谁施加了什么动作、动作强度是多少、还有哪些未观测因素同时变化。因而它擅长学习世界的可能性分布,不天然擅长回答“如果机器人改做另一个动作,会发生什么”。从相关性跨到因果性的关键,不是继续增加相似视频,而是加入可对齐的动作接口、成对反事实、失败轨迹和真实结果。
Sand.ai 以自回归视频模型 MAGI-1 为公开技术锚点。自回归架构天然适合连续时间展开,也能把用户创作与编辑行为变成产品反馈。它的长期命题是让 Agent 产品带来交互数据、数据训练模型、模型继续改善产品。这个飞轮在内容产品中可以较早成立,但向 Physical AI 延伸还要补齐动作条件、3D 几何、物理约束和真实策略收益。
内容产品数据与机器人数据的经济性截然不同。创作平台可以低成本获得海量提示词、重生成、编辑与留存,它们能精确表达用户偏好和控制意图,却很少包含真实力、接触和执行器状态。机器人部署的数据量小得多,但一次失败往往同时包含动作、环境和结果。视频公司的机会不是把两类数据混在一起,而是用产品数据学习语义、对象与长时叙事,再用稀缺动作数据校准可执行部分。
生数科技从 Vidu 延伸到 Motus / Motubrain,把数字内容生成与机器人行动放在统一世界模型战略下。Causal Forcing 系列推进实时、自回归、动作条件视频生成,Motubrain 则试图通过专家架构适配不同本体和任务。两条线能否共享底层表征、数据和训练 Infra,是判断“统一世界模型”是否成立的关键;视频商业收入本身不能替代机器人闭环证据。
生数公开资料进一步给出了可检验的系统设计:Motubrain 以视频、动作和语言三流建模,在训练中允许联合视频—动作监督,部署时可以通过 Video-to-Action 仅更新动作分支;官方披露完整推理约 5 Hz,动作路径可到 11 Hz,并以 50–100 条示范适配新本体。这些数字提供了比“统一世界模型”更具体的验证靶点,但仍应在独立硬件、接触密集任务和长时间运行中复核。
爱诗科技通过 PixVerse 积累全球视频产品用户,并把实时交互生成作为下一阶段方向。这类公司相较纯研究团队更早获得用户、付费和行为数据,但其数据主要表达创作偏好,不天然等于物理动作数据。必须证明用户交互能改善可控性、持久状态和动作后果,而不是只让内容更符合审美。
潜在动作提供了另一条桥梁:模型可以从无标签视频中推断造成画面变化的抽象动作,再用少量真实控制数据把抽象动作映射到机器人。2026 年的 in-the-wild 潜在动作研究显示,这条路线能从复杂视频中学习可转移变化,但在缺少统一本体时,动作仍容易退化为相机坐标附近的局部变化。它说明被动视频可以扩大先验,却没有消除“最后一公里”的动作落地问题。
V-JEPA 2-AC 又给出不同证据:大规模视频预训练后,只用不足 62 小时的无标签 DROID 机器人视频做动作条件后训练,即可用于目标条件规划。这个结果更支持“视频是可迁移表征底座”,而不是“视频模型直接等于机器人策略”。投资判断应追问视频先验究竟节省了多少机器人数据、提升了多少规划成功率,而不是只统计预训练视频规模。
同一谱系还包括 Video Rebirth、VAST、Sreal AI、Vivix、XMax.ai、Philo AI、Feeling AI、Arrival AI、魔芯科技、影溯等不同阶段项目。它们分别从自回归视频、3D 持久世界、多人动作条件生成和互动内容切入,不能因为都服务数字世界就被视为同一种公司。最有效的比较维度是:状态是否持久、动作是否可辨识、是否实时、是否能进入策略以及是否拥有真实反馈。
长时画面稳定,对象不会随镜头变化丢失身份
可主张动态生成→不同动作产生可区分、可重复的未来,且动作不是相机运动的替身
可主张动作条件→几何、接触、力和未发生的候选动作通过压力测试
可主张物理预测→预测相较无世界模型基线提高规划、训练或失败恢复
可进入决策闭环→部署失败被结构化并改善下一版本
可主张数据飞轮05|基础模型与大厂派:资源最完整,也最需要证明聚焦
基础模型创业者不一定从机器人或视频出发。他们更关心一个能够持续学习、自我改进并吸收多模态世界经验的系统。林俊旸团队被市场同时描述为基础模型、自学习系统、具身智能和世界模型,但截至核验日,公司产品、模型架构和正式路线尚未完整公开。多种说法可能指向同一长期目标,也可能只是融资阶段的宽泛叙事,不能在缺少模型或产品证据时提前归类。
它石智航代表大厂系统工程派。创始团队拥有智能驾驶、机器人和大型工程组织背景,公开路线把视触觉世界模型、全身控制、双足与轮足本体、工业任务和人类操作数据放进同一体系。其大额 Pre-A 融资已有公开媒体和机构信息支撑,但融资规模只说明资源充足;长期任务成功率、产线节拍、人工接管率和复制交付成本才决定其模型是否形成壁垒。
国内大厂则从视频基模、游戏世界、3D 重建和具身模型多个入口推进。游戏和互动内容更容易获得规模化用户、可控动作和即时反馈,因而适合作为早期训练场;机器人则提供更高价值但更昂贵、更危险的现实验证。大厂拥有算力、数据、场景和组织能力,创业公司拥有聚焦、速度和生存压力,双方优势并不对称。
需要特别区分“做世界模型”与“提供世界模型基础设施”。NVIDIA Cosmos 的官方定位覆盖视频数据处理、世界生成、后训练和合成数据,适合为机器人与自动驾驶制造边界场景或仿真素材;它可以成为训练底座,却不因此自动承担每台机器人的低层控制。国内大厂也可能选择出售云、算力、模型 API、仿真或数据服务,而不是亲自完成本体部署。这类生意的核心指标是开发者采用、下游策略增益和单位生成成本,不应与机器人任务成功率混为一谈。
对大厂而言,游戏和互动世界最大的价值不是“离机器人更近”,而是能够大规模记录清晰的动作输入与即时状态变化。它们适合训练长时记忆、空间导航、对象持久和反事实探索,但缺少真实接触、材料与安全代价。好的迁移策略会明确哪些能力从数字世界预训练,哪些必须用真实机器人校准;不好的迁移策略只会把交互视频规模当成物理理解的替代证据。
大厂最容易遇到的问题是世界模型与主营业务距离过远,团队在多个内部方向之间赛马,产品权限和商业优先级不断变化。创业公司最容易遇到的问题则是算力、数据和现金不足,为了融资不断扩大定义。真正可持续的竞争不是比谁拥有更大的名词,而是谁找到一个高频应用,让训练投入可以被客户价值和数据回流共同支撑。
商业上会出现三种不同公司:第一种卖模型或 API,靠调用规模和通用性;第二种卖数据、仿真与评测基础设施,靠生态和工作流锁定;第三种交付机器人任务,靠成功率、节拍与现场 ROI。三者都可能建立大公司,却对应不同毛利、回款周期和反馈权。最危险的叙事是用 API 公司的估值逻辑融资,却用重交付项目获取数据,同时没有证明两端能在同一经济模型中相互补贴。
聚焦可以用一个非常具体的问题检验:公司是否能指出一个最先取得反馈权的工作流。它必须有明确设备、任务频次、失败成本、预算负责人和数据回传条款。若团队只能列出十个潜在行业,却无法说明第一万个高质量失败样本从哪里来,资源优势仍停留在资产负债表上。
06|真正的技术分水岭不是表示形式,而是世界模型取得了多少决策权
视频、3D、物理量或 JEPA 隐空间描述的是表示形式,不等于系统职责。同一个视频模型可以只制造训练数据,也可以评估候选动作,甚至可以联合预测动作并直接控制机器人;同一个隐空间模型既可能只是预训练编码器,也可能在模型预测控制中承担规划。判断公司路线时,最有效的第一问是:模型输出会不会改变真实动作,如果会,改变到什么程度。
第一层是数据工厂。模型生成边界场景、补齐长尾或把仿真转成逼真观测,但不在运行时参与决策。Cosmos Predict / Transfer 代表这一类基础设施。它的证据不是生成画面有多惊艳,而是加入这些数据后,下游策略在未见场景中的成功率、鲁棒性或安全覆盖是否提升,并且单位有效样本成本低于真实采集。
第二层是训练教师。世界模型学习可迁移表征、奖励或未来监督,帮助策略用更少真机数据学习,但部署时可以被移除。V-JEPA 2-AC 用潜空间预测支持机器人规划,GigaWorld-Policy 则在训练时用未来视频约束动作、部署时允许关闭视频生成。这个层级的核心证据是样本效率和泛化增益:必须与相同数据、相同策略容量的无世界模型基线比较。
第三层是评估器与规划器。模型在运行时预演候选动作、排序策略或拒绝危险动作。LeCun 的自主机器架构让 actor 向 world model 提出动作序列,再由代价模块比较结果;DreamerV3 在想象轨迹中训练行为;WorldEval 则尝试用生成的策略视频近似真实评测。此时模型必须证明排序与真实结果相关、置信度可校准、时延满足规划窗口,而且错误时能退回安全控制器。
第四层是闭环控制器。世界动作模型直接产生可执行动作,并根据新观测持续重规划。DreamZero、GigaWorld-Policy、Motubrain 与 1X 的视频到动作路线都在争夺这一权限。决策权越高,单次 Demo 越不足以构成证据:必须同时报告闭环频率、长任务成功率、失败恢复率、人工接管、安全边界和跨场景稳定性。模型不能因为能“想象未来”就绕过低层控制、碰撞约束与紧急停止。
这条阶梯不是价值高低排序。数据工厂可能拥有更好的毛利和更广客户,闭环控制器可能拥有最稀缺的真实反馈,但也承担最高硬件、交付和安全成本。对投资与合作而言,关键是公司的商业模式、证据强度和责任边界是否与它声称的决策权一致。
行业也未必收敛到一个端到端参数模型。更可能先收敛的是接口契约:状态用什么格式查询,动作如何条件化,预测时延是多少,不确定性如何暴露,安全控制器何时否决,失败如何进入训练队列。只要这些接口稳定,像素、3D、物理引擎和隐空间可以并存;如果接口不稳定,再大的统一模型也只是内部研究原型。
生成、增强或翻译训练场景;运行时不参与真实动作。
- 怎么测
- 下游策略增益 ÷ 合成数据成本;长尾覆盖与域差
- 当前映射
- Cosmos、视频 / 仿真数据引擎
提供表征、奖励、未来监督或辅助损失;部署时可移除。
- 怎么测
- 同等数据与容量下的样本效率、泛化与收敛速度
- 当前映射
- V-JEPA 2-AC、训练期视频监督
在线比较候选动作、预测结果或拒绝风险动作。
- 怎么测
- 与真机结果的排序相关、置信校准、规划时延
- 当前映射
- WorldEval、Dreamer、MPC 式接口
直接产生动作并根据新观测持续重规划,承担执行后果。
- 怎么测
- 成功率、恢复率、接管率、控制频率与安全边界
- 当前映射
- DreamZero、GigaWorld-Policy、Motubrain
07|数据飞轮不是采集飞轮:只有因果密度、反馈权与跨本体复用同时成立
清晰应用场景是第一道门。它不等于宽泛的家庭、工业或游戏,而是一个有任务边界、频次、预算负责人和验收指标的工作流。世界模型只有在这个工作流中降低失败、减少真机试错、缩短部署或创造直接收入,训练成本才有持续来源。
数据资产至少有五个维度:规模决定覆盖上限,因果密度决定能否学习动作后果,分布覆盖决定是否见过关键变化,独占性决定竞争对手能否复制,反馈时延决定一次失败多久能影响下一版本。单纯公布“多少小时”会把这五件事压成一个无法比较的数字。十万小时被动视频可能不如一千小时带动作、失败和恢复标注的真机轨迹适合训练控制,但前者又可能在对象与场景先验上更有价值。
Open X-Embodiment 把来自 21 个机构的机器人数据转成标准格式,并用 RT-X 展示跨机器人训练的正迁移;它证明异构数据可以共享,却没有证明任何硬件都能零成本接入。DROID 的价值来自 50 名采集者、数百真实场景和数万条示范带来的环境多样性,BridgeData V2 则显示多任务、多环境数据能改善跨机构泛化。这些公开数据是很好的预训练底座,也意味着只使用同一份公共数据不会形成公司独占壁垒。
跨本体目前有三种主要工程策略。第一种像 RDT2 一样统一末端执行器和坐标接口,用硬件约束换取数据可移植;第二种像 Open X-Embodiment 与 π0.5 一样,对异构动作和任务做协同训练,让共享骨干吸收跨机器人规律;第三种从视频中学习本体不变的任务进度、奖励或潜在动作,再用少量真实数据映射到具体控制。三者不是相互替代:越靠近真实执行,运动学、力矩、传感与安全校准越无法被抽象掉。
公司真正需要管理的是一张“数据权利表”。客户是否允许采集失败,传感器与动作日志能否完整保留,数据能否跨客户训练,合成数据的来源和许可是否清楚,人工接管是否被结构化,删除和脱敏成本是多少。没有合同层面的反馈权,再好的部署也可能只产生收入,不产生模型复利;没有数据治理,所谓飞轮还可能形成合规负债。
Infra 决定这张数据表能否变成学习速度。关键环节包括时间同步与标定、失败切片、自动质量评分、训练数据谱系、离线回放、仿真压力测试、真机盲测、灰度发布与回滚。模型架构尚未收敛时,这些系统比某一版网络更耐久,因为它们缩短每个假设从发现到证伪的时间。可以用“每千 GPU 小时带来的真机成功率提升”和“每百小时新数据减少的人工接管”衡量实验产出,而不是只看训练吞吐。
人才与融资仍然重要,但都必须服从同一个闭环。早期团队可以依靠导师、同学和前同事聚集,扩大后必须让数据、评测、部署与商业拥有独立负责人;资本则要覆盖足够长的真机学习周期,同时不能掩盖交付摩擦。最危险的状态是估值上升,单任务采数、现场工程、人工接管和客户获取成本也同步上升。
因此,平台判断应该从“团队是否足够明星”改成“同一系统是否让下一次验证更便宜”。如果每增加一个任务、本体或客户都要重新采数、重新训练并由创始团队驻场,这仍是一家高端项目公司;如果公共预训练、共享世界表征和部署失败让下一次适配更快,基础模型平台才开始出现。
| 数据入口 | 规模潜力 | 动作—结果因果 | 真实任务贴合 | 防御性来源 | 最适合承担的角色 |
|---|---|---|---|---|---|
| 互联网 / 公开视频 | 极高 | 低:动作常不可见,混杂因素多 | 低—中 | 模型清洗、表征与训练效率 | 视觉、对象、运动与常识预训练 |
| 创作 / 互动产品日志 | 高 | 中:有控制与偏好,缺真实接触 | 低—中 | 自有分发与用户行为闭环 | 语义控制、长时一致与产品反馈 |
| 第一视角人类视频 | 高 | 中:意图强,机器人动作不可直接执行 | 中 | 采集网络、任务覆盖与对齐方法 | 任务进度、可供性与潜在动作 |
| UMI / 统一采集器 | 中—高 | 高:动作可对齐,硬件边界明确 | 中—高 | 采集硬件、协议与场景网络 | 低成本人类操作监督与跨臂迁移 |
| 机器人遥操作示范 | 中 | 高:状态、动作和结果同步 | 高 | 本体覆盖、质量控制与客户许可 | 策略后训练、接触动作与新任务 |
| 自主部署 + 接管日志 | 早期较低 | 最高:真实失败、恢复与代价可见 | 最高 | 装机量、反馈权和失败结构化 | 在线评测、恢复学习与长期数据飞轮 |
08|谁会成为 Physical AI 版 DeepSeek:用可证伪条件代替冠军预测
现在无法从融资速度、创始人履历或单次 Demo 判断谁会成为 Physical AI 的基础平台。高校派可能产生新的架构变量,自动驾驶派可能最快建立真实闭环,视频派可能掌握最大的预训练和产品数据,大厂派可能把算力与生态推到最高规模。任何一类都有可能胜出,也都有结构性短板。
技术瓶颈仍然明确:生成世界会违反物理规律,长时预测会累积误差,在线 rollout 可能达不到控制频率,真实机器人评测昂贵且难复现,不同本体和任务也缺乏统一标准。WorldScore 已把生成世界拆为可控性、质量与动态,WorldArena 继续追问数据引擎、策略评估和动作规划的功能价值,RoboArena 则用分布式、双盲、成对真机测试扩大任务多样性。三类评测说明行业必须同时回答“像不像、听不听动作、能不能帮助真实策略”,任何单一榜单都不够。
评测本身也可能成为重要基础设施。WorldEval 报告世界模型对不同策略与 checkpoint 的排序与真机结果相关,并可筛除危险动作;但这类代理评测必须持续用真实执行校准,否则模型会偏爱自己更容易生成的动作。最可靠的体系是三层证据:可重复的离线压力测试负责快速淘汰,受控真机盲测负责比较版本,客户生产指标负责验证长期价值。
范式收敛前,更清晰的机会包括全栈垂直整合、机器人策略评测、高质量数据精炼和推理系统。它们直接解决闭环缺口,也能从多条模型路线并行中受益。范式收敛后,边缘加速、模型—芯片协同、统一动作接口和开源模型配合低成本硬件,才可能成为更大的横向平台。机会窗口的分界不是某一年,而是跨公司评测、动作接口与部署合同开始标准化的时刻。
真正的 DeepSeek 类比不应落在“低成本训练一个很大模型”这一句话上。DeepSeek-V3 的技术报告把效率归因于 MLA、MoE、训练目标与工程系统的协同,并公开了训练资源口径;对 Physical AI 而言,对应物不是简单减少 GPU,而是把算法、动作表示、数据管线、推理与安全控制共同设计,让每一次真实交互带来更多可复用学习。
因此,值得追踪的是四条成本曲线。第一是新任务:达到验收成功率需要多少新示范和真机小时;第二是新本体:完成硬件接入、标定、后训练与安全验证需要多少天和多少人;第三是自主运行:每百小时需要多少人工接管、多少失败能自动恢复;第四是新客户复制:需要多少现场工程、非标硬件和创始团队时间。模型参数、视频质量和融资额只有在改变这些曲线时才进入公司价值。
还要区分“学习曲线下降”与“把成本转移给合作方”。客户提供免费数据、硬件厂商承担适配、研究人员长期驻场,都可能让公司账面成本看似下降。真正的平台效应要求记录全系统成本,并证明新知识能跨任务、本体和客户复用;否则只是供应链补贴了一个漂亮 Demo。
最终判断可以被证伪:如果公司经过至少三次新任务、两种新本体和两个独立客户后,适配数据、全口径现场工时、人工接管和单位交付成本没有下降,那么所谓基础模型尚未产生平台效应。反之,即使公司不使用“世界模型”标签,只要这四条曲线持续改善,并能由独立评测复现,它已经更接近 Physical AI 的基础层。
| 曲线 | 统一计量单位 | 必须固定的比较条件 | 出现平台效应的信号 | 常见伪改善 |
|---|---|---|---|---|
| 新任务学习 | 达到验收阈值的新示范数、真机小时、训练算力 | 本体、任务难度、成功率阈值 | 共享先验让数据和试验次数逐次下降 | 降低验收标准;隐藏失败与重试数据 |
| 新本体接入 | 日历天、人天、专用数据与硬件改造 | 能力相近的本体和相同任务集合 | 共享动作 / 世界表征复用,适配团队缩小 | 由本体厂商承担未计入的标定和控制 |
| 自主运行 | 每百小时接管、停机、不可恢复失败 | 相同现场分布、班次和安全限制 | 运行时间越长,恢复率提高、人工下降 | 只展示精选时段;把复杂情况交给人工 |
| 客户复制 | 单站点工程人天、非标 BOM、上线周期 | 相近流程与客户验收口径 | 模板、数据与评测可复用,毛利同步改善 | 创始团队驻场;渠道或合作方补贴交付 |
资料来源与核验口径
本文以公开资料中的主要论点、案例与数据为基础,加入本站图解和分析。公司或榜单自报结果按来源标注,无法独立复现的指标不作扩张解释。
中国世界模型市场观察与创业团队访谈行业访谈与市场观察
↗02北京市政府:悟界·Physis-v0.1 发布政府 / 研究发布核验
↗03智源研究院:当世界模型走向真实系统研究机构 / 技术路线
↗04RDT2:跨本体机器人基础模型论文
↗05RDT2 官方项目页:UMI 数据、动作表示与部署边界项目官方
↗06北京市经信局:厘清智能 Physical AI 路线政府 / 产业进展
↗07星海图公司官网公司官方
↗08极佳视界公司官网公司官方
↗09GigaWorld-Policy:训练期世界监督与高效动作解码论文
↗10流形空间公司官网公司官方
↗11MAGI-1:Sand.ai 自回归视频模型论文
↗12生数科技:世界模型战略与数据金字塔公司官方
↗13生数科技 Motubrain:世界动作模型架构、推理与适配公司官方 / 技术页
↗14新华网:它石智航 Pre-A 轮融资媒体 / 融资核验
↗15V-JEPA 2:自监督视频表征、预测与机器人规划论文
↗16Learning Latent Action World Models In The Wild论文
↗17DreamZero:World Action Models are Zero-shot Policies论文
↗18Open X-Embodiment:跨机器人数据标准与 RT-X论文
↗19DROID:大规模真实场景机器人操作数据项目官方 / 论文
↗20BridgeData V2:多任务、多环境机器人数据项目官方 / 论文
↗21π0.5:异构数据协同训练与开放世界泛化公司论文
↗22NVIDIA Cosmos:Physical AI 世界基础模型平台公司官方
↗23DreamerV3:在想象轨迹中学习策略论文
↗24A Path Towards Autonomous Machine Intelligence研究论文
↗25WorldScore:生成世界的可控性、质量与动态评测论文
↗26WorldArena:具身世界模型的感知与功能评测项目官方 / 论文
↗27RoboArena:分布式双盲真机策略评测项目官方 / 论文
↗28WorldEval:以世界模型评估真实机器人策略论文
↗29DeepSeek-V3 Technical Report论文
↗