亮源新创:互联网视频能否成为具身智能的预训练层?
姜旭把大语言模型的“预训练—对齐—部署”分工迁移到物理世界,押注先从人类视频压缩行为先验,再用机器人数据完成动作落地。真正决定路线成立的,不是视频小时数或模型代际比喻,而是无动作标签的视觉经验能否被翻译成可执行、可跨本体、可由少量真机数据校准的动作接口。
要点速览
- 亮源新创不是简单主张“视频越多,机器人越强”,而是在重排数据分工:互联网视频负责学习人类行为与世界先验,机器人数据负责把先验对齐到动作和动力学,部署失败负责校准长期运行。这个分工若成立,可绕开逐台机器人遥操作的规模瓶颈。
- 路线最难的部分不是视频理解,而是动作接口。公开视频缺少关节指令、力、触觉、奖励和未发生的反事实;Universal Action Representations 必须把任务意图和动作后果从相机运动、人物外观及具体身体结构中解耦,才能让少量真机数据完成落地。
- LAPA 与 V-JEPA 2 已提供行业级可行性证据:无动作标签视频可以改善潜动作学习或机器人规划。但它们同时说明视频只是可迁移先验,仍需机器人观测或动作数据完成最后对齐,不能据此认定亮源新创自己的基础模型已经被验证。
- 先做移动能力在数据和控制上有内在一致性:人体位移在公开视频中更可见,接触精度和动作维度通常低于灵巧操作。LightParkour 证明团队能完成 Real2Sim2Real 与机载控制,却是独立的运动策略证据,不是互联网视频预训练或跨本体基础模型的直接证明。
- 真正的平台效应只有一个可证伪标准:随着任务和本体增加,新增真机数据、适配人天、人工接管和单位交付成本持续下降。若每种机器人仍要重新采数、调参和驻场,所谓 Scaling 只是把高成本系统集成包在基础模型叙事中。
具身智能行业最昂贵的假设,是把“高质量机器人数据稀缺”当作一个只能靠更多遥操作、更多本体和更多现场采集解决的问题。亮源新创选择把问题拆开:先用互联网视频学习人类如何移动、接近、观察、避让和完成任务,再用有限真机数据告诉模型这些行为如何变成某台机器人的动作。这个判断借鉴了语言模型从预训练到对齐的经验,但物理世界没有天然 token、动作会产生不可逆后果、本体之间也没有统一语法。能否建立这套翻译接口,才是公司价值与风险的共同来源。
从行为压缩到本体对齐:检验一条预训练优先的 Physical AI 路线
六个章节沿着同一条因果链展开:先判断语言模型的 Scaling 哪一部分能够迁移,再拆开三类数据的职责,分析通用动作表征和跨本体接口,解释为何从移动而非灵巧操作进入产品,最后用五道证据门判断模型能力、硬件闭环与商业复利是否真的成立。
01|真正迁移的不是 ChatGPT 产品形态,而是训练阶段的分工
亮源新创的出发点来自一个训练经济学判断:机器人行业直接把遥操作和强化学习当作主要规模来源,会让每一小时训练数据都绑定具体硬件、场地、操作员和安全成本;语言模型的突破则来自先在更大、更便宜、覆盖更广的语料上形成通用先验,再用规模更小但更精确的人类反馈完成行为对齐。公司试图把同样的顺序改写为物理世界的“可规模化预训练—可规模化对齐—可规模化部署”。
这个类比有解释力,但不能照搬。文本预训练的输入和输出共享 token 接口,网页上的一句话可以直接成为下一词预测目标;视频中的人类行为没有天然动作标签。摄像机不知道手施加了多少力,也不知道人物为什么停下,更没有记录没有被选择的动作会造成什么结果。Physical AI 的预训练不是把视频切成更多 token 就结束,而是要把观测还原为对行动有用的变量。
因此,Scaling 的第一层含义不是参数更多,而是新增数据仍然带来可测的下游能力增益。若视频量扩大十倍,却只改善场景识别和视觉流畅度,没有减少机器人对齐数据,训练曲线就没有跨越模态边界。第二层含义是复用:一个任务上学到的行为结构能否被下一种本体调用。第三层才是部署:真实运行产生的失败能否修正共享模型,而不是只修补某台机器人的规则。
访谈用内部“GPT-2.5”描述当前模型资源位置,并预期未来出现类似“GPT-3.5”的能力跃迁。这类比喻可以表达团队的研发节奏,却不是行业通用的模型代际,也没有对应公开学习曲线、模型卡或统一评测。它不能回答参数、数据和算力分别增长多少,更不能替代跨任务成功率与适配成本。投资和技术判断应把它视为公司目标,而不是已经发生的能力结论。
公司当前最有价值的信号是组织结构与技术路径一致:姜旭在 OpenAI 参与过 InstructGPT、ChatGPT 和 GPT-4 的预训练、对齐、优化与基础设施,团队同时覆盖数据、模型、算力、硬件和部署。最主要的风险也来自同一结构:语言模型经验能提高训练系统能力,却不能自动提供接触动力学、机器人安全或制造复利。跨领域迁移最终只能由真机数据效率证明。
把路线写成一句可检验的命题,就是:在相同机器人数据预算下,经过大规模人类视频预训练的模型,能否在未见环境、任务和本体上更快达到相同成功率,并在运行中更少需要人工介入。只要比较实验没有回答这句话,视频规模、团队履历和融资都仍是能力的先验概率,而不是能力本身。
02|互联网视频、机器人数据与部署失败不是替代关系,而是三种不同监督
互联网视频最适合提供的是行为覆盖。它包含人如何在拥挤空间移动、如何从语言和场景判断目标、如何接近物体、如何把长任务拆成连续动作,也包含大量失败前兆和社会互动。即使没有精确控制信号,视频仍能教会模型哪些状态通常相邻、哪些对象可以被作用、一个任务大致走到哪一步。公司把视频清洗和处理列为过去一年最大的研发投入之一,说明它把数据工程而非单一网络结构视为预训练瓶颈。
但视频不能承担精确执行监督。关节位置、速度、扭矩、接触力、触觉、摩擦、执行器延迟和控制频率大多不在画面里;相机移动还会与人物动作混在一起。一个人把杯子放稳,视频记录了结果,却未记录抓取力的安全区间。机器人数据的职责因此不是重复教模型什么是杯子,而是把抽象行为映射到本体状态和可执行动作,并校准现实世界的代价。
部署数据又与遥操作示范不同。示范通常偏向成功、动作干净、场景受控;产品运行暴露的是遮挡、传感器漂移、用户打断、意外接触、路径被占用以及系统不知道自己错了。它最稀缺的价值是失败和恢复:哪一步需要人工接管,机器人能否发现偏离,什么安全机制阻止错误扩大。只有这些数据被结构化并回流共享模型,部署才不是售后成本,而是训练资产。
三类数据也对应三种完全不同的合规问题。公开视频需要来源授权、人物隐私和删除机制;机器人对齐数据涉及操作员、场所和设备知识产权;长期交互产品还会记录家庭或办公空间中的敏感信息。若数据权利不能跨产品版本继续使用,数据规模不会自然变成护城河。真正的 Data Scaling 需要同时记录数据量、有效监督密度、使用权和对下游曲线的边际贡献。
合理的训练账本不应只统计小时数,而应为每条样本标记它改变了什么能力。视频数据看对象与行为覆盖、动作可辨识度和相机混杂;机器人数据看状态—动作同步、接触信息和本体多样性;部署数据看失败类型、恢复路径、人工介入和真实任务代价。只有把数据职责分开,团队才能知道下一笔预算应该购买更多预训练覆盖,还是补充某个动作接口。
- 掌握事实
- 对象、场景、任务进度、可供性、人体运动与社会互动先验
- 单独使用的失效
- 缺关节动作、力触觉、奖励和反事实;容易学习相机与外观相关性
- 掌握事实
- 本体状态、动作坐标、接触、控制频率、动力学与安全约束
- 单独使用的失效
- 成本高、覆盖窄、绑定本体;单独扩大容易重复采数
- 掌握事实
- 真实长尾、用户打断、不可恢复错误、运行代价与产品分布
- 单独使用的失效
- 若无数据权和结构化回流,只会沉淀为售后工单
03|通用动作表征是整条路线的承重墙
从视频到机器人,中间必须存在一个不依附于具体身体、又保留动作后果的接口。亮源新创把它称为 Universal Action Representations。理想情况下,这个表示至少要拆开三件事:任务意图回答“为什么行动”,环境中的期望变化回答“世界应当怎样改变”,本体映射再回答“这台机器人用哪些关节和控制频率实现变化”。如果三者混成一个 latent,所谓跨本体就会把人类手臂、相机视角或某台机器人的动力学一起记住。
最有意义的抽象单位不是“人的右手向左移动”,而可能是“末端相对目标的位姿变化”“身体质心跨过某个支撑区域”或“保持安全距离并通过狭窄空间”。这类表示能被双足、轮式和四足通过各自控制器解释。可一旦任务进入摩擦、柔性物体和精细接触,身体无关的高层意图还不够,模型必须知道某种硬件能否实现动作,以及动作失败会造成什么后果。通用性因此来自分层,而不是删除本体差异。
Latent Action Pretraining(LAPA)提供了一个重要的行业参照:先从无动作标签视频中学习离散潜动作,用这些潜动作预训练 VLA,再以较少带动作的机器人数据映射到真实控制。结果支持“无标签视频可以成为动作预训练材料”,也暴露关键边界——潜动作首先是画面变化的压缩,不天然等于真实因果动作;背景和相机变化仍可能被误编码。亮源新创若采用不同结构,也必须回答同一组混杂问题。
V-JEPA 2 给出另一种证据。其视觉世界表征先在超过百万小时互联网视频上自监督预训练,随后用不足 62 小时的无标签机器人视频训练动作条件模型,并在 Franka 机械臂上进行目标条件规划。这个结果说明大规模被动视频可以提高机器人规划的样本效率,但仍保留了机器人域对齐阶段。它支持亮源新创的训练分工,却不能证明任意互联网视频都能自动变成跨本体策略。
公司内部同时探索自回归和 Flow Matching,当前更重视自回归预训练的扩展效率。架构选择本身不是决定性差异:自回归适合把序列预测和大规模训练组织成稳定目标,Flow Matching 常用于连续、多峰动作分布;真正应该比较的是同等算力和真机数据下的学习曲线、控制延迟、长时误差与恢复能力。如果更换生成头就显著破坏跨本体表示,说明主干尚未形成稳定动作接口。
访谈还提到位于多个端到端模型之上的 model harness。它可以负责选择、组合或约束不同策略,让移动、交互与安全模块共享高层状态;也可能只是把多个专用模型编排在一起。二者商业含义完全不同:前者可能形成可扩展的模型平台,后者更接近系统工程。判断方式是观察新增能力时究竟复用了共享表征,还是新增了一套数据、模型和规则。
跨本体最强的验证不是同一网络在三台机器人上都能运行,而是适配曲线。应固定任务难度和成功率阈值,记录冻结多少主干参数、增加多少适配参数、采集多少新数据、需要多少人天,并与从头训练或常规 VLA 微调比较。若第二种、第三种本体的边际成本持续下降,Universal Action Representations 才从概念变成资产。
04|为什么先做移动:它是预训练假设最容易被证伪的第一站
亮源新创把首款产品指向具有通用移动、思考和交互能力的轻量级具身智能体。移动优先并不只是避开灵巧手的硬件难度,它与视频预训练的数据分布一致:人体行走、转身、绕行、停靠和跟随在公开视频中大量可见,动作效果主要体现在身体和相机轨迹;手指力、接触点、摩擦和遮挡后的状态则很难从普通视频恢复。
移动也更适合检验跨本体抽象。双足、四足和轮式底盘的低层控制完全不同,但高层任务可以共享目标位置、可通行区域、动态障碍、社交距离和恢复策略。如果同一表征能把“穿过人群去到桌边”映射到不同身体,路线会得到早期强证据。相反,如果能力只在自研硬件和固定路线成立,就说明共享的可能只是导航语义,而非跨本体行为模型。
LightParkour 是当前最具体的公开技术证据。项目从短人类动作种子出发,在物理仿真中扩展地形与运动分布,通过 Real2Sim2Real 训练一个循环深度策略,再部署到 90 cm、18.9 kg、21 个主动关节的 Lightbot 0。项目与论文报告策略以深度视觉、本体感知和速度指令为输入,在机载设备上以 50 Hz 运行,不依赖运行时参考轨迹、技能标签、外部跟踪或离板状态估计。
它证明了团队能把动作参考、物理仿真、感知策略和自研硬件闭成一个工程环,也说明公司不是只做视频研究。然而 LightParkour 的训练证据来自短动作种子、物理建模和仿真随机化,不是访谈所描述的互联网规模视频基础模型;其目标是复杂地形运动,也不是多任务交互智能。把它放在正确位置,结论应是“本体与运动控制能力已出现”,而不是“行为预训练主张已被证明”。
移动产品的商业挑战也不低。传统导航栈已能在结构化场所完成定位、路径规划和避障,基础模型必须在开放指令、未知环境、动态人群、语义目标和失败恢复上提供明显增量。若产品只完成“从 A 到 B”,客户会按底盘、续航和成本采购;只有当系统能理解模糊目标、处理打断并在环境变化中恢复,预训练行为先验才会进入定价。
因此,首代产品 Demo 不应只展示一次流畅行走。更有价值的是在未提前建图或布局变化的环境中,由自然语言给出含歧义目标,中途加入移动障碍和用户改口,并展示机器人如何识别不确定性、请求确认、重新规划、在失败后恢复。还应同时报告百次任务成功率、每小时接管、恢复率、端到端延迟和不同本体适配成本。
| 比较维度 | 通用移动 | 灵巧操作 | 对亮源路线的含义 |
|---|---|---|---|
| 公开视频可见性 | 人体轨迹、绕行、跟随和停靠大量可见 | 手指遮挡多,力、触觉和摩擦不可见 | 视频预训练更容易先覆盖移动先验 |
| 动作抽象 | 目标、路径、可通行区可跨双足 / 四足 / 轮式共享 | 抓取姿态、自由度和末端结构高度本体相关 | 移动更适合早期验证 Universal Action Representations |
| 低层控制 | 可交给成熟定位、运动与安全控制器 | 接触过程要求高频闭环和精细力控 | 分层系统可先让基础模型负责高层移动决策 |
| 错误容忍 | 多次路径可达;常可停下、绕行或重规划 | 滑落、碰撞和损坏可能瞬间不可逆 | 移动能更安全地收集失败与恢复数据 |
| 现有竞争 | 传统导航成熟,语义理解与开放环境必须带来增量 | 通用灵巧能力仍稀缺,但数据和硬件成本更高 | 首产品需要证明的不只是行走,而是理解、交互和恢复 |
| 决定性指标 | 未见布局成功率、每小时接管、恢复率、跨本体适配天数 | 接触成功率、物体 / 材质泛化、力峰值、长任务完成率 | 先建立同一套跨版本、跨本体评测账本 |
05|自研硬件不是终局,而是把模型缺失变量暴露出来的实验装置
公司当前同时做模型、算力、数据、硬件和部署,并披露已经开发人形与较低自由度轮式本体,也在第三方本体上做过实验。对一家声称长期提供通用模型的公司,这看似矛盾:如果目标是跨本体,为什么还要自己造机器人?答案在于早期市场没有统一、可观测、可安全修改的参考平台。没有底层控制与传感器权限,团队很难区分模型错误、执行器误差和系统集成问题。
自研本体的合理角色是测量仪器。它应让团队控制时间同步、动作频率、传感器、故障注入和数据回流,快速暴露表示中缺失的变量;一旦接口稳定,外部本体接入成本应下降。若每次模型迭代都必须依赖自有机械、专用零件和创始团队联调,硬件就不再是实验装置,而会把公司锁进垂直整合和制造现金流。
长期开放生态能否成立,取决于接口而非口号。至少需要定义观测规范、形态描述、动作空间、时间同步、安全约束、适配器训练和评测协议。第三方本体厂商愿意接入的条件,是模型能缩短其开发周期、提高开放任务成功率,且不会夺走客户和运行数据。亮源新创尚未公开 SDK、模型许可、适配成本或合作清单,因此开放平台仍是方向,不是已建立的生态。
首款轻量级具身智能体还承担另一项任务:建立类似 ChatGPT 的低摩擦交互入口。语言模型的能力并非在产品出现前完全不可见,但对话界面让用户可以随时提出任务、纠正结果并产生偏好数据。物理智能体若长期存在于同一空间,也能获得上下文、习惯和任务反馈;它的价值可能从单次自动化转向持续协助、环境记忆和主动服务。
这种交互飞轮比网页对话更敏感。机器人会记录空间布局、人员活动与物品位置,也能采取有物理后果的动作。产品必须把数据同意、离线能力、删除权、权限分层、儿童与访客保护以及紧急停止做成系统结构,而不是上线后的隐私条款。模型越能主动行动,越需要清楚区分“可以建议、可以准备、可以执行、必须确认”的权限边界。
商业化最好的首场景未必是任务最复杂的场景,而应同时满足四个条件:移动与交互确有未满足需求;错误可以被安全停止和恢复;用户愿意持续使用并授权反馈;现场分布足够丰富,能改善共享模型。一个封闭、每次都由工程师兜底的展示空间会产生漂亮 Demo,却不能形成可扩展数据资产。
融资和组织扩张提高了执行概率,也提高了验证压力。公司从 2026 年 5 月访谈中的约 60 人增长到 8 月公告中的超过 100 人,并完成数亿元 Pre-A 轮。高密度小团队的叙事将在百人阶段接受新考验:模型、硬件和产品需要共享同一组里程碑,否则每条线都可能有自己的 Demo,却没有一条产品闭环。
管理上最重要的共同指标不是各模块的论文、模型参数或硬件版本,而是端到端学习效率:每个真实失败从发生到进入评测集需要多久;修复是否提高多个本体而非单台样机;一个版本的能力提升是否降低下一客户的部署工时。只有这些指标把模型、数据、硬件和产品绑在一起,全栈才是优势而不是组织负担。
06|把宏大叙事改写成五道证据门:每通过一道,模型才获得更多行动权
亮源新创的路线拥有一套自洽的理论:公开视频提供最大的行为覆盖,人类动作表征承担跨本体翻译,少量机器人数据完成对齐,自研硬件制造闭环,长期交互产品产生部署反馈。它的优势是正面解决机器人数据不可无限扩张的问题,也与创始团队的大模型训练经验相匹配;风险是链条上的每一个箭头都可能损失信息,而任何一处损失都能被下游工程暂时掩盖。
第一道门应验证视频是否学到行为,而不只是外观。需要在未见人物、背景和相机条件下测试任务进度、可供性、动作顺序和零动作识别,并用相机扰动、背景替换和动作交换检查混杂。第二道门验证对齐效率:在同一机器人数据预算下,与无视频预训练、通用视觉预训练和 LAPA / V-JEPA 类基线比较,报告达到相同成功率所需的真机小时。
第三道门是跨本体。固定一组从未参与预训练的任务,分别接入轮式、双足或四足平台,公开冻结参数比例、适配参数量、标定时间和新数据量。若所谓通用动作表示只能在同形态机器人之间迁移,适用范围应被准确限定。第四道门是长期运行:模型必须在传感器噪声、布局变化、打断和失败后恢复,报告连续运行时长、每百小时接管和不可恢复故障。
第五道门才是商业复利。应把第二种本体、第二类任务和第二个独立客户与第一次交付比较,统计全口径工程人天、专用硬件、训练算力、现场支持和单位毛利。客户或硬件伙伴承担的适配成本也必须计入,否则成本只是被转移。只有边际成本下降,基础模型才产生平台效应。
LightParkour 已让公司获得一部分本体工程和运动控制证据,融资与百人团队提供了扩大实验的资源;公开资料仍缺预训练数据构成、模型结构、视频—动作对齐消融、跨本体曲线、产品 SLA 和客户部署。这个证据位置既不应被低估为“只有概念”,也不能被抬高为“通用物理智能已经出现”。更准确的表述是:训练范式明确、工程系统开始形成、核心迁移命题尚待公开验证。
如果路线成功,亮源新创最重要的资产不会是某一代机器人,而是一套让互联网行为知识不断被翻译到新身体的生产机制;每增加一个本体,模型会更懂哪些行为可共享、哪些必须本地校准。如果路线失败,最可能的原因也不是视频不够多,而是人类行为与机器人动作之间不存在足够稳定的低成本接口,导致每次落地仍需大量真机工程。
未来跟踪时,应少问“模型到了 GPT 的哪一代”,多问五个数字:视频预训练节省多少机器人数据,新本体适配需要多少天,未见任务成功率提升多少,每百小时人工接管多少,第二个客户的交付成本下降多少。它们共同回答同一个问题:亮源新创是在训练一个可以复用的 Physical AI 基础模型,还是在为每台机器人重新建设一套智能。
换人物、背景和相机后,动作顺序与任务进度仍可识别;零动作不被误编码
可主张行为预训练→同等成功率下,视频预训练显著减少机器人数据与训练算力
可主张数据效率→冻结大部分主干,以少量适配数据接入不同形态并保持未见任务能力
可主张通用动作表征→布局变化、打断和失败下,每百小时接管与不可恢复错误持续下降
可进入受限部署→第二本体、第二任务和第二客户的全口径边际成本同步下降
可主张基础模型平台资料来源与核验口径
本文以公开资料中的主要论点、案例与数据为基础,加入本站图解和分析。公司或榜单自报结果按来源标注,无法独立复现的指标不作扩张解释。
麻省理工科技评论中国:ChatGPT 核心贡献者归国创业访谈核心访谈
↗02亮源新创 About:团队与 Physical AI 路线公司官方
↗03亮源新创:数亿元 Pre-A 轮融资公告公司公告
↗04亮源新创 WAIC 访谈:状态、动作与三阶段 Scaling公司访谈
↗05亮源新创:互联网视频与机器人数据的训练分工公司访谈
↗06LightParkour 官方项目页研究项目
↗07LightParkour:Real2Sim2Real 运动控制论文论文
↗08OpenAI:Roger Jiang 对 GPT-4 的贡献机构官方
↗09OpenAI:InstructGPT 研究与作者信息机构官方 / 论文
↗10LAPA:Latent Action Pretraining from Videos论文
↗11V-JEPA 2:互联网视频预训练与机器人规划论文
↗12Open X-Embodiment:跨本体机器人数据与 RT-X论文
↗13π0.5:异构数据协同训练与开放世界泛化公司论文
↗