物理 AI
让 AI 在物理规律约束下感知、推理、行动并承担真实后果,覆盖机器人、自动驾驶、无人系统、工业控制与物理仿真。
范围通常大于具身智能;重点是智能是否进入物理系统。聚焦中国 Model-first 公司:从 VLA、世界动作模型和跨本体大脑,到仿真、数据与端侧计算底座,比较技术、资本、团队与商业闭环。
具身智能、Physical AI、世界模型、VLA、空间智能和机器人经常出现在同一句话里,但它们分别描述产业范围、系统形态、模型组件、策略接口、表征能力与物理载体。
让 AI 在物理规律约束下感知、推理、行动并承担真实后果,覆盖机器人、自动驾驶、无人系统、工业控制与物理仿真。
范围通常大于具身智能;重点是智能是否进入物理系统。智能体通过传感器和身体与环境持续交互,在“感知—决策—动作—反馈”循环中学习和完成任务。
不等于人形机器人;轮式、机械臂、无人机也可以是具身智能体。学习环境状态、时间演化和动作后果,使系统能够在行动前预演未来、比较方案或生成训练环境。
不天然等于具身智能;只有进入规划、控制或机器人训练时才形成物理闭环。把视觉观测和语言指令映射为机器人动作,可端到端输出控制,也可与规划器、世界模型和低层控制器组合。
强调“该做什么”;世界模型更强调“做了以后会怎样”。理解三维几何、物体关系、可达区域和空间变化,为导航、操作、重建与 Real2Sim 提供环境底座。
空间重建是重要输入,但若没有动作和反馈,仍不是完整具身系统。由本体、传感器、执行器、控制器和软件组成的工程系统,是具身智能最主要但不是唯一的承载方式。
传统固定程序机器人不一定具备学习、泛化或世界建模能力。按主要技术入口,把全部公司归入世界模型 × VLA、原生世界模型、3D / 空间模型、物理仿真、自回归视频和数据 / Infra;分类强调主路线,不否认公司同时采用其他模块。
判断一家公司不能只问“是不是世界模型”,而要继续问:它预测的是像素、三维空间、环境状态还是动作后果;预测结果是否进入控制;真机反馈能否再次变成训练数据。路线的终点不是生成一个逼真的世界,而是让机器人在世界里作出可验证的行动。
越向右越接近动作与真机结果;越向左越接近训练燃料和世界表征。
把环境预测接入视觉—语言—动作策略,让“理解任务、预演后果、执行动作”进入同一个训练与推理闭环。
以世界状态预测本身作为产品和模型核心,先学习物理变化、因果关系与可交互环境,再向规划和控制延伸。
从三维生成、重建和空间理解切入,为机器人建立可查询、可编辑、可持续更新的空间底座。
用物理仿真、生成环境和合成轨迹扩大训练分布,把高成本、危险或稀缺的真机试错移入可控环境。
借助视频生成学习环境随时间变化的统计规律,用海量视频替代部分昂贵的机器人交互数据。
提供真实采集、合成数据、标注、仿真、感知硬件和评测工具,解决基础模型训练中的覆盖度、质量和成本问题。
原文并置了李飞飞团队、王仲远与 Yann LeCun 的观察框架。把它们合在一起看,能够避免把“视频生成”“空间重建”和“物理预测”混为一谈。
区分模型是在生成观察、推演世界状态,还是直接给出行动。三者可以串联,但评测目标完全不同。
判断模型把什么当作“世界”。语言擅长抽象,像素擅长外观,3D擅长几何,隐表征更适合压缩与预测。
真正面向物理 AI 的转折,是从预测内容序列转向预测受动作影响的物理状态,并让预测服务于决策。
世界模型与 VLA 从二选一走向协作:前者负责预演,后者负责理解指令与输出动作。
路线竞争正在从视觉演示转向任务成功率、长时一致性、故障恢复和真实部署成本。
数据采集、合成、仿真与评测从辅助工具变成模型性能和迭代速度的决定因素。
Google Genie、NVIDIA Cosmos、World Labs、Sora、JEPA 与 Tesla FSD 构成不同技术锚点。
技术演示若不能映射到成功率、节拍、接管率与客户 ROI,融资速度可能快于收入形成。
六条路线会持续交叉;只押单一表征或单一生成能力,容易在融合阶段失去位置。
视频、3D和交互式世界模型训练与推理昂贵,算力供给和端侧效率会直接限制部署。
真人视频、真实场景和众包采集涉及授权、隐私与安全,合规成本会随规模同步上升。
路线口径这里按公司当前最主要的技术入口归类,而不是按宣传标签归类。现实中同一家公司往往同时使用 VLA、世界模型、强化学习、仿真和真实数据;单一路线用于建立可比较的主坐标,不意味着排除其余能力。
为具身模型提供国产端侧计算底座,以旭日芯片、RDK 开发套件和软硬件工具链承接感知、大模型推理与实时运动控制。
面向 Physical AI 提供物理仿真、合成数据和评测基础设施,通过真实物性测量与 GPU 求解器生成机器人可用的训练数据。
以 SYNTH 架构联合建模视觉、力觉和触觉,并用 REMA 连接任务理解、动作策略与高频控制,构建面向接触操作的物理 AI 平台。
聚焦可离线运行的端侧空间智能,通过 NeutronBrain-E 与国产计算平台协同优化空间理解、任务规划和机器人本地决策。
从边缘智能延伸到工业 Physical AI,以多模态空间感知、VLA 和“一脑多体”Agent 服务电力、能源与流程工业。
专注具身导航与全身避障,通过可适配多种本体的“导航小脑”帮助人形、轮足和轮式机器人在动态环境中自主移动。
围绕长程灵巧操作研发端到端 VLA、触觉示教工具和仿真数据引擎,重点解决衣物等非刚性物体的泛化抓取与多技能串联。
以 Polibrain OS 构建类脑分区式“具身大脑”,坚持真实家庭数据和自主闭环,并以软件与平台服务适配不同机器人本体。
以 Spirit VLA、开放式真实数据采集和 Moz 全力控机器人共同推进通用操作智能,并在工业产线检验长时序任务能力。
围绕“以力为中心”的物理AI基础模型构建数据采集、训练、技能库和部署工具链,重点解决接触丰富的精细操作任务。
以共享隐空间世界模型、强化学习和失败知识库训练长时序操作能力,重点提升高精度任务中的失败归因与自主恢复。
依托西湖大学机器智能研究,采用“多模态大脑 + 通用行为专家小脑”双预训练架构,让四足、双足和人形本体共享全身运动能力。
以 Xiaoyu Brain 驱动多种工业本体,从非标焊接切入,用真实产线部署建立工艺数据、模型迭代和规模交付闭环。
以 G0 VLA、Fast-WAM 世界动作模型和 R1 / Kengo 等自研本体形成模型—数据—硬件闭环,同时服务开发者与工业客户。
以低成本多摄像头采集工厂三维动态数据,通过原生 3D 世界模型驱动工业机器人,首站聚焦鞋类涂胶等柔性制造工序。
以 DM 具身原生模型、Dexbotic 开发框架、RoboChallenge 真机评测和仓储机器人组成操作智能闭环,并通过合并补足场景与数据。
坚持“模型定义本体、软件定义硬件”,将统一世界模型 / VLA、i7 Pro 本体和 CNC 等制造部署放入同一迭代闭环。
以 FAM 超少样本操作模型和 BridgeV2W 世界模型降低新任务适配成本,同时向本体厂商授权“大脑”并交付行业机器人。
坚持大小脑一体的统一世界—行动模型,以真实家庭、互联网视频和无机器人采集数据训练跨任务、跨本体的开放场景能力。
以 GigaWorld 世界模型、GigaBrain 行动模型和 Maker 本体组成全栈闭环,让生成式物理预测直接服务机器人策略学习与执行。
以第一视角视频预训练世界模型,让机器人先在潜空间推演动作后果,再用少量下游数据适配新任务和新本体。
以 4D 世界重建、可控扩散和合成数据构建高保真预训练场,并进一步研发触觉大模型和机器人数据产线。
公开渠道尚未找到能够与“灵液视界”名称稳定对应的官网或工商主体;目前仅保留其数据与视觉基础设施方向,具体产品和团队均待确认。
以 Lixel 三维扫描硬件、3DGS 重建和 Real2Sim 工具链把真实空间转成可交互仿真环境,服务机器人训练和数字孪生。
面向汽车、航空航天和装备制造研发 AI CAD、AI CAE 工程智能体,用基础模型与小样本微调加速设计和物理仿真流程。
把外卖骑手网络变成室内第一视角数据采集系统,以 RGB、深度、语义和运动轨迹数据训练具身导航大脑。
采用“仿真优先、少真机示教”的操作智能路线,以高保真物理环境训练策略,再通过 #sudo R1 检验零样本 Sim2Real 迁移。
面向机器人和 AI 穿戴设备提供主动防抖感知底座,以 SMA 光学减震模组和生成式防抖模型稳定运动相机画面。
由智源研究院孵化,围绕 ω-EVA 具身交互世界模型构建可跨机器人本体使用的多模态空间智能与通用具身大脑。
围绕 3D Gaussian Splatting 开发真实空间重建与生成式高斯模型,为数字孪生和机器人仿真提供高精度、可实时渲染的三维场景。
以 Terra-1 世界模型生成可受动作影响、符合物理规律的交互场景,为自动驾驶、工业视觉和机器人提供训练与测试合成数据。
从通用 3D 基础模型与 Tripo 创作工具切入,通过生成、重建和可交互空间技术降低三维世界生产成本。
以环境式多模态数据采集、Kairos 世界模型和 A1 端侧大脑模组构建跨本体智能层,并在零售、酒店与巡检场景推进验证。
以低延迟“附体式”遥操作作为即时交付和真机数采入口,通过 TeleAvatar 轮式人形在服务场景中逐步积累自主策略能力。
依托蚂蚁集团推进 LingBot 世界模型、视频—动作模型与跨本体 VLA,尝试在统一预训练框架中连接未来生成和全身控制。
以原生视觉语言模型和世界模型为机器人“大脑”,同时建设本体、视触觉感知、仿真与真实数据飞轮的全栈具身智能公司。
围绕汽车线束和精密装配构建视触觉世界模型、全身端到端控制及双足 / 轮足机器人,是面向高难工业任务的全栈路线。
面向仓储拣选构建融合世界模型的 Ulti-Brain 分层策略,使机械臂和 EDGE 机器人在不预采客户场景数据时执行零样本分拣。
小米集团内部机器人研究团队,连续布局实时 VLA、十万小时级真实轨迹训练和自回归世界模型,并开放模型及后训练方法。
把自动驾驶团队积累的芯片、系统、算法与数据能力迁移到机器人,以 VLA、世界模型和强化学习形成感知—推理—控制闭环。
以仿真合成数据和轮式双臂本体切入可复制零售,再向工业与康养扩展。
以 GOVLA / NeuroVLA 统一移动、双臂和身体姿态控制,并通过 AlphaBot 2 及工业订单检验全身具身模型的交付能力。
把规模化量产与“部署态”作为主线,以全品类本体、模型、数据、RaaS 和开发者生态构建平台。
以力、接触与运动因果关系为核心构建物理世界模型,并用双臂五指灵巧操作任务验证长程精细控制能力。
面向数字世界的 AI 原生游戏团队,以 GameGPT 多智能体框架和 Magi Scapes 生成式沙盒探索可持续演化的角色、规则与交互环境;尚无机器人或物理本体部署证据。
成立于上海的早期世界模型与具身大脑研发团队,当前公开业务指向 AI 实验室服务,尚未披露模型名称、技术报告或机器人产品。
定位机器人的“视觉中枢”,通过快速 3D 物体与环境重建、世界模型和仿真策略训练帮助智能体学习复杂空间任务。
以多模态感知模型和“悠然无界”世界模型组成双引擎,通过 Geek Mind 将空间推理与任务规划适配机器人、无人机和边缘设备。
以 KOKONI-World 为核心构建可交互的 4D 世界基座模型,覆盖动态场景重建、编辑、新视点生成与物理仿真。
以可交互的生成式物理世界扩展机器人训练数据,把状态变化和动作后果转化为可用于策略学习与 Sim2Real 校正的训练环境。
以统一世界模型连接 Vidu 数字内容生成与 Motus / Motubrain 机器人行动,通过多层视频与真机数据训练跨本体策略。
以图像、视频和 3D 交互的生成与理解为当前产品重心,并把原生多模态模型作为逐步通向垂直世界模型的技术底座。
以视频基础模型为核心,同时推进生成应用与世界模型研究,主张用大规模视频学习场景演化规律,再向可交互环境延伸。
六类闭环覆盖首页全部中国基础模型公司。公司只按主要能力重心归组;图中箭头表示六类能力如何循环,不表示公司之间存在合作关系。
互联网先验如何迁移到动作
谁拥有失败、接管与再训练权
合成数据能否跨过 Sim2Real
传感器、执行器与模型共设计
部署前预测成功、风险与 OOD
把成功率变成客户 ROI
首页仅呈现已有明确近期动态的中国基础模型公司;完整公司页面中的动态、融资和团队信息均标注更新时间。
智元展示全尺寸人形机器人自主乒乓球能力;此前 6 月 29 日宣布第 15000 台具身机器人下线。
WAIC 2026 同期发布 ACE-Data-0 与 PHYSICAL IQ 评测平台,并展示面向即时零售、酒店洗衣和开放巡检的晓满、晓新、晓途。
新版本支持无限时长交互世界生成、720p 60fps 实时推理,并提供 14B 与 1.3B 两种规模。
公司新闻页披露 2026 年上半年 B、B+、B++、C 四轮融资均已全额交割;同期推出 WALL-WM、WALL-OSS-0.5 与 X-Tokenizer。
报道列出经纬、五源、光合、蚂蚁与高瓴等投资方;公司计划 2026 年底发布旗舰通用世界基座模型,融资仍待一手公告补强。
资金将继续投入 WorldScape、WorldArena、数采硬件与硬件在环评测体系。
公开报道显示,极佳视界 2026 年 3—6 月累计融资约 35 亿元;更高估值及赴港上市讨论尚无公司一手确认。
北京市投资促进服务中心披露天使++轮进展,并列出与 ZF LIFETEC、Aumovio 等产业伙伴的合作。
此前 3 月 2 日完成 25 亿元 B++ 轮融资,刷新其上一轮约 3 亿美元的单轮融资纪录。
公司称模型仅使用仿真数据训练,在未见物抓取中进行 60 分钟连续评估;98% 等结果仍属公司自报。
坐标覆盖首页全部 53家公司。横轴描述产业资产重量,纵轴描述主要训练数据来源;位置依据公开技术路线归纳,不代表公司官方分类或排名。
横坐标综合自研本体、芯片、端侧系统和制造投入;纵坐标综合真实轨迹、真机验证、客户部署与合成 / 仿真数据的相对权重。数值是基于公开信息的相对定位,不是公司官方指标或排名。
INFORMATION NOTE / 信息说明公司披露、第三方信息与分析结论分开表达。优先采用一手来源,融资、估值、人员、客户和交付等动态信息标注更新时间;没有可靠公开来源时明确写“未披露”或“待确认”,不采用未经证实的行业传闻。