同叫世界模型,却在学习不同的世界:15 条创业与研究线索的技术分野
从动作—后果、跨本体策略、显式因果、可交互视频、持久三维世界到可微物理仿真,逐项拆解十家公司、三条学术路线与两项未证实线索,回答什么样的世界模型才真正进入 Physical AI 闭环。
要点速览
- “世界模型”不是一条统一赛道。真正决定技术性质的不是是否生成视频,而是模型把什么当作状态、动作如何进入状态转移,以及预测结果是否被策略、搜索或控制器实际使用。
- 这批线索可归入五类底层对象:动作—后果耦合、跨本体动作表征、干预式因果与物理状态、自回归可交互视频、持久或可执行数字世界;厘清智能的 Real-to-Sim-to-Real 更接近贯穿多类对象的训练基础设施。
- 十家公司已有可核验主体与公开路线,但证据成熟度差异很大:Tripo 已有付费 3D 产品,生数、极佳与 Sreal 已有论文或代码链路,X-Era 拥有真实商业交互入口;Olympus、LiberAI 公司级世界模型及多项通用物理模型仍缺少完整模型卡或生产部署验证。
- “因果”至少有四个不同层级:时间单向生成、动作条件控制、干预稳健性、可反事实复用的机制结构。Causal Forcing 主要解决第一层,CD-LAM进入第二至第三层;仅使用 causal attention 不能证明模型理解了物理因果。
- 一家公司若要证明自己在做 Physical AI 基础模型,必须展示同一模型让新任务或新本体所需数据下降、闭环成功率上升、失败可恢复,并在真实分布变化下保持动作—结果一致;清晰视频、游戏得分或宏大融资都不能替代这组证据。
把所有项目都叫作“世界模型”,会掩盖最重要的架构选择。IPR-1 用想象 rollout 评价策略,RDT2 用统一动作表征跨本体迁移,CD-LAM试图从视频中剥离动作无关的视觉混杂,Causal Forcing 把双向视频扩散压缩为可流式生成,Project Eden 则把世界状态从摄像机画面中分离。它们共享“预测世界”的语言,却在学习完全不同的对象,也需要完全不同的验证方法。
从“预测什么”开始,重新辨认世界模型
八个章节沿着同一条判断链展开:先拆开被混用的概念,再比较动作、因果、视频、持久状态与仿真五类技术对象,最后用证据阶梯判断哪些已成为公司能力,哪些仍停留在论文或线索阶段。
01|先拆概念:世界模型的分水岭不是画面,而是状态、干预与用途
一个最小世界模型可以写成状态转移:给定当前状态 s、动作 a 和环境条件 c,预测下一状态或未来轨迹。真正的分歧藏在三个变量里。状态可以是像素、3D 对象图、隐空间动力学、接触与力,也可以是可执行程序;动作可以是真实关节控制、潜动作、键鼠输入或自然语言规则;预测结果可以只用于生成,也可以进入搜索、策略训练、动作选择和失败恢复。
因此,视频模型是否算世界模型不是非黑即白的问题。动作条件视频能低成本吸收外观、运动和部分交互规律,是很强的观测生成器;但如果物体离开视野就失去身份,换一个动作而结果几乎不变,或者预测不能改善策略,它还没有形成可供智能体使用的世界状态。相反,可执行规则模型即使没有逼真画面,也可能因为可验证、可搜索而更接近决策系统所需要的模拟器。
这批线索可以按“主要学习对象”分成五类。第一类学习动作与未来之间的耦合,用 rollout 或未来视频辅助策略;第二类建立跨本体动作空间,解决不同机器人数据无法共同训练;第三类追求干预下稳定的因果或物理状态;第四类压缩视频生成,使世界能够低延迟连续展开;第五类保存持久状态、显式规则或可微物理,使环境能被搜索、编辑和复用。Real-to-Sim-to-Real 则是把这些模型放进数据生产系统的方法论。
分类不是给团队贴永久标签,而是明确每条路线最容易被误读的地方:动作模型不一定显式模拟世界;自回归中的“因果”不一定是因果发现;空间模型不一定拥有动力学;物理引擎不一定能覆盖开放世界;论文能力也不能自动等同于公司产品。只有把预测对象和决策接口说清,路线比较才有意义。
- 主要状态
- 观测 + 动作 + 未来视觉 / 回报
- 决策接口
- 策略打分、动作解码、规划
- 关键检验
- 换动作后,预测和成功率是否同步改变
- 主要状态
- 可干预变量、潜动作、下一物理状态
- 决策接口
- 去混杂、反事实、分布外迁移
- 关键检验
- 背景或相机变化时,动作效应是否保持
- 主要状态
- 帧 / 视频 latent 的时间演化
- 决策接口
- 实时生成、交互预览、视觉 rollout
- 关键检验
- 长时一致性、控制延迟、动作跟随
- 主要状态
- 对象、事件、规则、可查询的长期状态
- 决策接口
- 多智能体共享、MCTS、可复用模拟
- 关键检验
- 离开视野后状态是否保存,规则能否验证
- 主要状态
- 几何、材质、力学参数或领域场
- 决策接口
- Real2Sim、系统辨识、合成训练
- 关键检验
- Sim-to-Real 增益是否大于建模成本
02|动作中心路线:最有价值的想象,不是生成未来,而是改变当前决策
IPR-1 的核心不是训练一个更漂亮的视频生成器,而是把世界模型放在策略的外部评审席。VLM 先提出候选动作,世界模型展开可能的未来,rollout 的结果再用于评分和强化策略。PhysCode 进一步把不同游戏的语义意图和动力学动作压进共享编码,使模型能在 1,000 多个游戏中寻找跨界面、跨视觉风格的物理不变量。它验证的是“想象能否改善选择”,而不是“像素能否逼真复现”。
这条路线的优点是模块边界清楚:推理模型负责提出行动,世界模型负责预演,评价器负责回传信号。它也暴露出从游戏到机器人的巨大断层。键鼠或离散游戏动作的作用边界清晰,真实机器人动作却同时受控制频率、接触力、执行器误差、遮挡和安全约束影响。IPR-1 已是 CVPR 2026 学术成果,但未发现独立公司主体,也未找到其与蚂蚁灵波围绕 IPR-1 的公开合作材料;这只能说明公开证据不足,不能据此推断是否存在未披露合作。
极佳视界的 GigaWorld-Policy 把同一问题改造成行动中心的 World–Action Model:训练时同时预测动作与动作条件未来视频,让视觉动力学成为动作学习的稠密监督;推理时通过因果隔离阻止未来视频 token 反向泄漏给动作 token,因此可以省略显式视频解码。其价值在于保留世界建模的训练增益,却不必为每次控制支付生成整段视频的延迟。GigaWorld-Policy-0.5 又通过 Mixture-of-Transformers 把视觉动力学与动作生成分给不同专家,论文报告本地 RTX 4090 上约 85 ms 推理延迟。
这一设计也带来明确取舍:如果未来视频只在训练期出现,部署时获得的是被世界预测塑形过的策略,而不是可供在线搜索、解释和反事实比较的显式模拟器。它更像“用世界模型训练更好的 policy”,而不是“机器人运行时先做梦再行动”。投资或采购时应把两种能力分开验证:前者看动作成功率、延迟和跨场景泛化,后者还要看多候选 rollout 的校准度与规划收益。
- 获得
- 可比较多种未来,适合规划与解释
- 代价
- 运行时计算更重,模拟误差直接影响选择
- 获得
- 把物理视觉信号写入策略,同时压低部署延迟
- 代价
- 运行时没有显式未来,反事实搜索能力需要另证
03|跨本体路线:统一动作空间解决的是数据复用,不自动等于世界模拟
刘松铭的 RDT2 与 LiberAI 代表另一种起点:世界不先被建模为可视未来,而是先把不同本体的动作翻译成可共享的表征。RDT2 使用增强版 UMI 收集超过 10,000 小时、与机器人本体相对解耦的人类示范,再以 7B VLM、残差向量量化、flow matching 和蒸馏连接离散语义与连续控制。其目标是新物体、新场景、新指令乃至新机器人上的零样本迁移。
这类模型最重要的状态不是像素世界,而是“人想完成什么动作结构,以及不同机器人如何实现它”。残差向量量化把高维连续行为压成组合式 code,能够减少每种机械臂都重新定义动作词表的成本;flow matching 则保留多模态连续轨迹。若新本体接入所需数据和微调显著下降,这本身就是基础模型价值,即使它没有在运行时输出未来视频。
LiberAI 已有公司主体和融资报道,但目前公开最扎实的技术证据仍来自创始团队的 RDT-1B / RDT2 研究。论文的跨本体结果不能直接等同于公司尚未公开的“物理世界模型”已完成相同验证。公司下一步真正需要证明的是:自研数据接口、动作表征和本体系统能否让第二种、第三种机器人接入越来越快,而不是只在一个高自由度 Demo 上展示复杂动作。
胡钰承参与的 UAM 则从 VLA 微调中的“具身税”切入:动作训练可能破坏预训练 VLM 的语义能力,因此以并行 Dorsal Expert 承担时序预测与控制相关计算,并通过梯度隔离保护语义通路。它与 WAM 的交叉点在于把未来状态或子任务表征作为动作学习的中间监督,但核心问题是语义能力与控制能力如何共存,并非构建独立世界模拟器。胡钰承有连续论文与公开报告记录,未发现以其为创始人的公司信息。
跨本体路线的护城河不能用参数量衡量,而要看“适配函数”是否真正缩短:同一技能迁移到不同自由度、相机布局、末端执行器和控制频率时,需要多少新数据、多少人工标定、多少控制器特例。没有这四项数字,跨本体仍可能只是数据集内的形式统一。
04|因果路线:必须区分时间单向、动作可控、干预稳健与机制复用
“因果世界模型”最容易产生概念错位。第一层是时间单向:模型只能看过去生成未来,技术上常用 causal attention;第二层是动作可控:改变动作输入,预测结果应随之改变;第三层是干预稳健:改变背景、相机或无关物体时,动作效应保持;第四层才是机制复用:模型能表达可干预变量与结构,在未见环境中回答反事实并支持规划。四层逐级变强,不能因为名称中出现 causal 就自动跨级。
Aether AI 的 CD-LAM 瞄准第二到第三层。普通 Latent Action Model 用相邻帧重建学习潜动作,容易把背景、相机移动和未被操作的物体也编码进动作 latent,形成视觉混杂。CD-LAM 用前景加权重建、动作语义对比学习和 latent 校准,让“没有变化”的重复帧靠近零动作,并让潜空间更多按动作而不是场景聚类。这样做没有直接恢复完整结构因果图,却把一个关键干扰源从动作接口中剥离。
论文在 2B 与 14B action-conditioned world model 上报告动作跟随误差下降超过 30%,并显著减少机器人动作后训练更新;公司技术文章还披露 3,000 步达到基线约 50,000 步的参考水平。这里最有价值的不是单一百分比,而是评价口径发生改变:画面保真和动作遵循的相关性很弱,所以一个看起来真实的视频可能完全没有服从动作。所有具身世界模型都应增加零动作、动作交换、背景干预和目标动作迁移测试。
逆矩阵的 Physis 选择更宏观的“预测下一物理状态”:公开材料称其希望统一 RGB-D、点云、力触觉、视频和动作,服务工业、机器人、物理仿真与科学预测。它比纯视频路线更明确地把多模态物理状态作为目标,但截至核验日,公开技术细节、模型卡、可复现实验和公司与智源研究成果之间的知识产权边界仍有限。融资规模证明资源动员能力,不证明模型已经获得机制级因果泛化。
过去 → 未来;不能偷看未来帧
- 怎么测
- 流式生成、长时漂移、首帧延迟
- 当前映射
- Causal Forcing 的核心语义
动作变化 → 预测结果可辨识地变化
- 怎么测
- 零动作、动作交换、动作跟随误差
- 当前映射
- WAM / ACWM 的最低门槛
背景、相机、无关对象变化不应篡改动作效应
- 怎么测
- 去混杂、跨场景与跨本体迁移
- 当前映射
- CD-LAM 重点推进
显式或可查询地表达变量、结构与反事实
- 怎么测
- 未见组合、反事实规划、失败归因
- 当前映射
- Aether / Physis 的长期命题,尚待强证据
05|视频路线:实时生成解决“世界能不能跑”,却没有回答“世界是否真的存在”
朱军团队与生数科技的 Causal Forcing 解决的是双向视频扩散教师与自回归学生之间的架构错位。双向教师在生成一段视频时能同时利用整段上下文,自回归学生只能利用过去;直接用前者初始化后者会违反论文所需的逐帧可逆条件,使学生学到条件期望而不是正确 flow map。Causal Forcing 先得到自回归教师,再做 ODE 初始化与分布匹配,Causal Forcing++ 又以 causal consistency distillation 将生成压到逐帧 1—2 步。
这套技术的真正产业意义是把高质量视频底座转成低延迟、可控制、持续展开的环境。minWM 进一步开放了从双向 T2V / TI2V 基座、相机控制微调、自回归训练、少步蒸馏到流式推理的全栈流程。对游戏与数字内容,它已经接近可用工具链;对机器人,它提供廉价的视觉 rollout 和动作条件数据,但仍需补上对象持久性、接触力、几何一致性和真实策略增益。
这里必须再次强调术语边界:Causal Forcing 的 causal 主要是生成方向与注意掩码的因果性,不等同于黄碧薇路线中的因果发现或去混杂。前者回答“如何只看过去、快速生成未来”,后者回答“动作是否真的造成预测结果”。两者可以组合,但不能相互替代。
邹应天创办的 Sreal AI 把视频路线推进到“多个行动者共享一个世界”。MultiWorld 不属于 Code World Models;它是动作条件视频世界模型。Multi-Agent Condition Module 用身份嵌入消除多个角色动作的归属歧义,并动态提高正在行动者的条件权重;Global State Encoder 则利用 VGGT 的三维特征,把不同摄像机观测压缩为共享状态。一个模块回答“谁做了什么”,另一个回答“不同视角看到的是不是同一个事件”。
MultiWorld 的价值在于把多人游戏和多机器人协作放进同一结构:智能体与相机数量都可变化,不同视角可以并行生成。官方项目页报告在《双人成行》数据上将 FVD 从对比方法的 207—245 降至 179,并实现约 1.5 倍多视角生成加速;机器人部分使用 RoboFactory 的 2—4 机器人离线轨迹。它证明了多主体、多视角可控生成,却还没有证明真实机器人会因为这些预测而提高协作成功率。Sreal 的首个商业入口因此更可能是游戏和数字内容生产,而不是直接销售机器人控制系统。
Video Rebirth 先以 BACH 进入专业视频生成,公开技术强调 Dual DiT、角色与叙事一致性以及 Physics-Native Attention;公司称计划在 2026 年末推出 Olympus,使环境能实时交互并表现重力、碰撞与声音。BACH 已形成产品和融资证据,Olympus 截至核验日仍是路线规划,未见完整模型卡、代码或机器人任务增益。其最大挑战是把电影级“物理感”升级为可测的状态守恒与动作因果,而不是继续优化视觉可信度。
视频路线最合理的阶段性指标也应改变:早期看首帧延迟、吞吐、动作跟随和长时一致性;中期看同一隐藏状态能否支持多视角和对象持久性;进入 Physical AI 后必须看生成数据或 rollout 是否提升真机策略、减少失败采集与人工干预。越靠后,VBench 一类视觉指标的解释力越弱。
06|持久与可执行世界:像素、状态和代码是三种完全不同的模拟器
VAST 的 Project Eden 从“世界是否独立于摄像机存在”出发,把底层结构化状态与最终视觉渲染解耦。状态层保存粗几何、对象身份、语义、事件与动作后果,渲染只是观察该状态的一种方式。由此,多名用户或智能体可以从不同视角进入同一个持续运行的世界,物体离开镜头后仍被保存。相比逐帧视频,它把记忆从上下文窗口提升为系统原生状态。
这条路线与 VAST 已有的 Tripo 3D 资产生成形成自然数据闭环:创作者生成、编辑、拓扑、绑定和导出的过程,能够积累比纯视频更结构化的空间资产。商业上也更稳健,因为 3D 创作、API 和插件已经能收费,Project Eden 可以在既有用户和资产上迭代。但持久状态不自动带来精确接触动力学;一个能记住火是否熄灭的世界,仍可能无法正确预测夹爪摩擦和柔性物体形变。
Code World Models 走向另一极端:让 LLM 把自然语言游戏规则与轨迹编译成 Python 状态转移、合法动作和终止函数,再交给 MCTS 搜索。它没有追求视觉逼真,却拥有可执行、可枚举和可验证的规则接口。公开论文在十个游戏上评测,其中四个为新游戏;这证明“世界模型”可以是程序,而不仅是神经视频 latent。它最适合规则可形式化的数字环境,迁移到真实世界则会遭遇规则不完备、连续动力学和传感噪声。
Code World Models for General Game Playing 的公开作者名单中没有上海交大邹应天,这篇论文与其没有可核验归属关系。邹应天的创业方向另有明确证据:MultiWorld 官方项目页把他的作者单位写为 Sreal AI,云启资本 2026 年 7 月的活动记录进一步将其介绍为 Sreal AI 创始人。Sreal 的公开路线是生成式世界引擎与多智能体多视角视频世界模型,而非代码世界模型。北京大学梁一韬团队的 JARVIS-1 则在 Minecraft 开放世界研究基础模型驱动的长任务智能体,仍未发现其创办世界模型公司的公开证据。
持久世界与可执行世界最终可能汇合:前者提供跨视角的长期对象状态,后者提供明确的转移规则和搜索接口,再由生成模型负责视觉呈现与未知规则补全。真正困难的不是让三层同时存在,而是建立一致性约束:代码判定门已打开时,结构状态、画面和智能体观测必须同时更新。任何一层漂移,都会让规划建立在一个互相矛盾的世界上。
- 掌握事实
- 外观、运动观感、连续观测
- 单独使用的失效
- 看起来合理,但对象或物理状态可能漂移
- 掌握事实
- 对象身份、空间、事件、跨视角记忆
- 单独使用的失效
- 状态可保存,但接触与规则可能过粗
- 掌握事实
- 合法动作、状态转移、终止条件、搜索
- 单独使用的失效
- 规则可验证,但开放世界难以完整形式化
07|从显式物理到公司资产:谁在建立可复用的能力闭环
厘清智能的技术路线不是孤立训练一个视频模型,而是把人类数据采集、物理 tokenization、可微物理引擎、强化学习与真机部署串成 Real-to-Sim-to-Real。真实数据用于识别几何、材质与动力学参数,仿真放大稀缺和危险状态,策略再回到真机暴露系统误差,失败数据继续修正仿真分布。这是一条“能力工厂”路线,价值取决于整条闭环是否让后续任务更便宜。
可微物理的优势是误差可以穿过模拟器反向优化参数或策略,适合摩擦、质量、刚度等可参数化问题;神经世界模型则更擅长吸收难以手写的视觉与复杂交互分布。二者结合的合理分工不是让神经网络替代所有方程,而是由显式引擎守住守恒、碰撞和约束,把未建模残差交给学习系统。厘清智能的公司、融资和团队信息已公开,但关键技术指标主要来自公司或媒体叙述,仍需模型卡、跨本体数据效率和真实客户工作流验证。
王可泽并非只有一条待观察的学术线索。他的个人主页明确写明 X-Era Lab 联合首席科学家,公开采访则将 X-Era Lab 与拓元智慧对应。公司官网把核心模型称为世界动作模型,强调空间建模与物理建模解耦,并以内生世界模型监督动作预测。“除法网络”更可能是对“有理函数网络”的误记:后者确实出现在团队公开技术描述中,指向用分式函数增强非线性与物理机制表达,而不是一家名为“除法网络”的项目。
X-Era 更值得注意的是数据起点。公司称其无人零售等系统每天实际服务接近 500 万次,从开门、抓取、挪动、放回到异常交互,能够形成真实而含噪的动作—状态—反馈序列;这一数字是商业系统服务量,不能等同于机器人自主动作量。团队将这类数据组织为 4D 时空状态加交互变量的“4D+X”,试图让模型先分离空间几何与物理演化,再联合输出未来过程和动作。它的决定性验证不是再做一段生成视频,而是证明这种内生监督让新本体所需数据下降,并在遮挡、接触和分布变化下提高闭环成功率。
“电磁世界模型”需要拆成两条公开事实。其一,华为确有 MindSpore Elec / MindElec AI 电磁仿真套件,官方文档披露在华为终端手机容差场景中,S 参数误差约 2%、端到端仿真速度提升 10 倍以上;这是 AI for Science / 工程仿真能力,不是名为“硅一智能”的创业公司。其二,中国移动与北邮联合体系明确使用“电磁世界模型”术语,用 WiWorld-RealData、ChannelLM 与 ChannelAgent 建模信道、波束和网络配置。两者都在学习物理场,但动作接口不是机器人关节,因此不纳入机器人公司竞争表。
nanobot 则处在范围之外:公开项目是轻量开源个人 AI agent,核心是多渠道聊天、工具调用、记忆、模型路由和自动化。它可以成为软件智能体基础设施,但没有物理状态、动作—后果学习或机器人闭环。关于项目发起者 Xubin Ren “考虑做世界模型创业”的说法没有公开材料支持,因此只能列为未证实线索,不能进入公司技术比较。
十家已确认公司的竞争关系并不是谁拥有更大的“世界模型”三个字,而是谁把能力嵌入了可积累的资产。VAST 拥有 3D 创作用户、资产和 API;生数拥有视频基础模型、开源蒸馏链路与数字内容入口;极佳视界把数据生成、行动模型和自研本体连成全栈;Aether 把因果去混杂做成可插入既有 ACWM 的训练模块;Sreal 选择多人游戏与多视角交互数据;X-Era 则从既有商业系统获取结构化真实交互。它们的护城河分别落在空间资产、工程工具链、本体闭环、方法接口和数据入口。
仍依赖未来证据的部分各不相同。LiberAI 需要把创始团队跨本体研究转化为公司级模型和接入效率;逆矩阵需要公开多模态物理状态的模型结构、评测与授权边界;Video Rebirth 需要让 Olympus 从视频产品路线图变成可运行、可交互、可验证的状态系统;厘清智能要证明昂贵的全栈 Real-to-Sim-to-Real 能降低第二客户和第二本体的边际成本;Sreal 要把视频一致性转成实时交互或策略增益;X-Era 则要把真实数据规模转成可复现的模型指标。
商业化次序也会反过来塑造模型。以内容与 3D 工具先收费,能获得高频用户反馈,却容易优先优化视觉与创作指标;以机器人本体切入,能获得真实动作和失败数据,却受制于硬件迭代与现场服务;以训练基础设施切入,容易进入多家客户,却必须证明数据与仿真对不同模型都有稳定增益;以纯基础模型切入,技术上最自由,却最容易缺少可观测的付费闭环。
因此,相似公司的正确比较单位不是“融资额或 Demo 观感”,而是新增能力的边际成本:每增加一个任务、一种本体、一个客户或一个环境,是否共享同一状态表征、训练系统和失败数据;还是重新采数据、写规则、调控制器、派工程师驻场。前者会形成基础模型复利,后者更接近高端系统集成。
| 公司 | 主要技术对象 | 当前商业 / 产品入口 | 最强公开证据 | 决定性待证问题 |
|---|---|---|---|---|
| 极佳视界 | 动作中心 WAM + 数据引擎 + 本体 | GigaWorld、GigaBrain、Maker | 连续论文与真机基准;85 ms 为论文设定 | 训练增益能否跨客户、本体和长时任务复现 |
| LiberAI | 跨本体动作表征与物理行动 | 公司世界模型与灵巧本体仍在早期 | RDT2:7B、万小时级 UMI、跨本体研究 | 论文能力能否转成更低的本体接入与交付成本 |
| Aether AI | 因果去混杂与 action-conditioned world model | 因果训练方法与 Physical AI 研发 | CD-LAM 开源;公司披露 2,000 万美元种子轮 | 是否能从潜动作去混杂扩展到机制级跨环境迁移 |
| 逆矩阵 | 多模态下一物理状态 | 通用世界基座模型研发 | 公司与超 1 亿美元种子++轮可核验 | 模型卡、第三方评测及公司 / 研究院成果边界 |
| 生数科技 | 少步自回归视频与动作条件世界模型 | Vidu 内容产品、minWM、Motus / Motubrain | Causal Forcing 系列论文、代码与模型 | 视频 rollout 对真机成功率和数据效率的净增益 |
| Sreal AI | 多智能体、多视角动作条件视频 | 生成式世界引擎;游戏与数字内容 | MultiWorld 论文、项目页;数千万元天使轮 | 共享视觉未来能否支持长时交互与真实多机器人决策 |
| VAST / Tripo | 持久结构状态 + 3D 生成 | Tripo Studio、API、插件与 3D 资产 | 成熟数字产品;Project Eden 研究预览 | 持久世界能否获得接触动力学与机器人训练价值 |
| Video Rebirth | 工业视频基础模型 → 实时交互世界 | BACH 专业视频生成 | 公司披露累计 8,000 万美元融资;BACH 已发布 | Olympus 尚未发布,物理状态与机器人闭环待证 |
| 拓元智慧 / X-Era | 4D+X 原生世界动作模型 | 无人零售与工业真实交互数据 | 公司主体、融资、官网路线及王可泽任职可核验 | 真实服务数据能否降低跨本体学习成本并提高闭环成功率 |
| 厘清智能 | 物理 token + 可微物理 + Real-to-Sim-to-Real | Physical AI 数据、仿真与本体交付 | 公司、数亿元种子轮及政府调研可核验 | 全栈系统能否降低第二客户和第二本体的边际成本 |
08|最终判断:世界模型只有进入闭环,才会从生成能力变成基础设施
判断一个项目是否值得进入 Physical AI 基础模型名单,可以连续通过五道门。第一道是状态:模型是否保存了任务真正需要的变量,而不是只保存外观。第二道是干预:改变动作时,未来是否按同一机制改变。第三道是决策:预测是否被搜索、策略或控制器实际使用,并带来可量化增益。第四道是迁移:新环境、新任务或新本体需要的新增数据是否下降。第五道是经济性:闭环部署产生的失败数据能否自动回流,并让后续交付更快。
五道门的顺序不能颠倒。没有动作干预就讨论因果,是把时间相关性当机制;没有决策增益就讨论机器人世界模型,是把视频生成当策略;没有迁移成本下降就讨论基础模型,是把多任务 Demo 当平台;没有交付复利就讨论商业护城河,是把融资和团队声望当产品证据。
对研究团队,最有说服力的下一步不是成立公司公告,而是补齐反事实评测:零动作、动作交换、背景干预、跨视角持久性、长时误差累积和闭环策略提升。对创业公司,最有说服力的不是再发布一个世界模型名称,而是公布同一任务在有无世界模型时的数据量、成功率、恢复率、推理延迟和人工介入变化。
这批团队真正可能形成互补而非零和竞争:Aether 的去混杂动作空间可以进入视频 ACWM;生数的少步蒸馏可以降低 rollout 延迟;Sreal 的多智能体条件和共享视角状态可以补上协作环境;VAST 的持久状态可以提供长期事实源;X-Era 与厘清分别从真实 4D 交互和可微物理约束世界转移;极佳与 LiberAI 的动作模型负责把表征压回可执行控制。最终赢家未必拥有单一最强模型,而可能最先定义这些模块之间可验证、可替换、可复用的接口。
截至 2026 年 8 月 9 日,十家公司可以进入持续跟踪名单;李永露、梁一韬、胡钰承应以学术团队或个人研究方向观察;“华为硅一智能”这一公司名称和 nanobot 创业意向仍未证实。邹应天已确认创办 Sreal AI,王可泽已确认担任 X-Era Lab 联合首席科学家。清晰区分论文归属、学术职务和公司角色,才能同时避免把传闻拼成不存在的公司,以及把已经公开创业的研究者继续当作纯学术线索。
任务变量可查询;遮挡与跨视角不丢失
生成 / 标注→零动作、动作交换、背景变化下结果符合机制
反事实评估→同数据下策略成功、恢复或规划效率上升
训练 / 建议→新任务、新本体所需数据与调试时间下降
受限闭环→失败自动回流,第二客户边际成本下降
平台化部署资料来源与核验口径
本文以公开资料中的主要论点、案例与数据为基础,加入本站图解和分析。公司或榜单自报结果按来源标注,无法独立复现的指标不作扩张解释。
IPR-1:Interactive Physical Reasoner(CVPR 2026)论文 · 一手技术资料
↗02上海交通大学:李永露教师主页高校官方
↗03Code World Models for General Game Playing论文 · 一手技术资料
↗04上海交通大学:邹应天教师主页高校官方
↗05MultiWorld:多智能体多视角视频世界模型论文项目页 · 一手技术资料
↗06上海交大工业技术创新研究院:Sreal AI 公司介绍高校产业平台
↗07云启资本 WAIC 回顾:邹应天与 Sreal AI投资机构活动记录
↗08Sreal AI:数千万元天使轮融资报道
↗09北京市科委:逆矩阵成立与种子++轮政府 / 公司事实
↗10量子位:Physis-v0.1 物理隐空间与多模态状态技术发布报道
↗11Causal Forcing论文 · 一手技术资料
↗12Causal Forcing++论文 · 一手技术资料
↗13minWM:实时交互视频世界模型开源框架论文 · 一手技术资料
↗14Aether AI:2,000 万美元种子轮公告公司公告
↗15CD-LAM:Causally Debiased Latent Action Model论文 · 一手技术资料
↗16GigaWorld-0:World Models as Data Engine论文 · 一手技术资料
↗17GigaWorld-Policy-0.5论文 · 一手技术资料
↗18极佳视界:GigaWorld、GigaBrain 与 Maker公司官网
↗19RDT2:跨本体机器人基础模型论文 · 一手技术资料
↗20投中网:刘松铭与 LiberAI 技术路线人物采访 / 公司事实
↗21UAM:A Dual-Stream Perspective on Forgetting in VLA Training论文 · 一手技术资料
↗22北京大学:梁一韬研究方向与教师信息高校官方
↗23王可泽个人主页:X-Era Lab 联合首席科学家高校教师个人主页
↗24X-Era AI:世界动作模型官网公司官网
↗2536氪:X-Era Lab 世界动作模型与 500 万次真实服务入口人物采访 / 公司事实
↗26钛媒体:拓元智慧近亿元 Pre-A 轮融资报道
↗27Project Eden:持久多人世界模型公司研究页
↗28Tripo:3D 基础模型与 Project Eden 研究入口公司研究页
↗29生数科技:世界模型战略与产品路线公司公告
↗30Video Rebirth:BACH 发布公告公司公告
↗31Forbes:Video Rebirth 与 Olympus 路线人物采访 / 媒体
↗32北京市经信局:厘清智能 Physical AI 路线政府 / 公司事实
↗33投资界:厘清智能数亿元种子轮融资报道
↗34中关村泛联院:WiWorld-RealData 电磁世界模型数据集研究机构 / 行业发布
↗35WiWorld-RealData:6G 无线世界模型真实数据集论文 · 一手技术资料
↗36华为 MindSpore Elec:AI 电磁仿真套件官方技术文档
↗37HKUDS nanobot:开源个人 AI Agent开源项目
↗