图谱首页/深度洞察/公司技术路线网站更新于 2026-08-23
INSIGHT / 01
公司技术路线

亮源新创:互联网视频能否成为具身智能的预训练层?

姜旭把大语言模型的“预训练—对齐—部署”分工迁移到物理世界,押注先从人类视频压缩行为先验,再用机器人数据完成动作落地。真正决定路线成立的,不是视频小时数或模型代际比喻,而是无动作标签的视觉经验能否被翻译成可执行、可跨本体、可由少量真机数据校准的动作接口。

READ THIS FIRST

要点速览

  1. 亮源新创不是简单主张“视频越多,机器人越强”,而是在重排数据分工:互联网视频负责学习人类行为与世界先验,机器人数据负责把先验对齐到动作和动力学,部署失败负责校准长期运行。这个分工若成立,可绕开逐台机器人遥操作的规模瓶颈。
  2. 路线最难的部分不是视频理解,而是动作接口。公开视频缺少关节指令、力、触觉、奖励和未发生的反事实;Universal Action Representations 必须把任务意图和动作后果从相机运动、人物外观及具体身体结构中解耦,才能让少量真机数据完成落地。
  3. LAPA 与 V-JEPA 2 已提供行业级可行性证据:无动作标签视频可以改善潜动作学习或机器人规划。但它们同时说明视频只是可迁移先验,仍需机器人观测或动作数据完成最后对齐,不能据此认定亮源新创自己的基础模型已经被验证。
  4. 先做移动能力在数据和控制上有内在一致性:人体位移在公开视频中更可见,接触精度和动作维度通常低于灵巧操作。LightParkour 证明团队能完成 Real2Sim2Real 与机载控制,却是独立的运动策略证据,不是互联网视频预训练或跨本体基础模型的直接证明。
  5. 真正的平台效应只有一个可证伪标准:随着任务和本体增加,新增真机数据、适配人天、人工接管和单位交付成本持续下降。若每种机器人仍要重新采数、调参和驻场,所谓 Scaling 只是把高成本系统集成包在基础模型叙事中。

具身智能行业最昂贵的假设,是把“高质量机器人数据稀缺”当作一个只能靠更多遥操作、更多本体和更多现场采集解决的问题。亮源新创选择把问题拆开:先用互联网视频学习人类如何移动、接近、观察、避让和完成任务,再用有限真机数据告诉模型这些行为如何变成某台机器人的动作。这个判断借鉴了语言模型从预训练到对齐的经验,但物理世界没有天然 token、动作会产生不可逆后果、本体之间也没有统一语法。能否建立这套翻译接口,才是公司价值与风险的共同来源。

2024 年底公司成立深圳;北京、新加坡设研发团队
>100 人公司披露团队规模截至 2026-08;研发人员占比超过 90%
数亿元Pre-A 轮融资2026-08;国科投资领投
50 HzLightParkour 机载策略频率项目 / 论文口径;不等于基础模型推理频率
ONE CONTINUOUS ARGUMENT

从行为压缩到本体对齐:检验一条预训练优先的 Physical AI 路线

六个章节沿着同一条因果链展开:先判断语言模型的 Scaling 哪一部分能够迁移,再拆开三类数据的职责,分析通用动作表征和跨本体接口,解释为何从移动而非灵巧操作进入产品,最后用五道证据门判断模型能力、硬件闭环与商业复利是否真的成立。

01|真正迁移的不是 ChatGPT 产品形态,而是训练阶段的分工

亮源新创的出发点来自一个训练经济学判断:机器人行业直接把遥操作和强化学习当作主要规模来源,会让每一小时训练数据都绑定具体硬件、场地、操作员和安全成本;语言模型的突破则来自先在更大、更便宜、覆盖更广的语料上形成通用先验,再用规模更小但更精确的人类反馈完成行为对齐。公司试图把同样的顺序改写为物理世界的“可规模化预训练—可规模化对齐—可规模化部署”。

这个类比有解释力,但不能照搬。文本预训练的输入和输出共享 token 接口,网页上的一句话可以直接成为下一词预测目标;视频中的人类行为没有天然动作标签。摄像机不知道手施加了多少力,也不知道人物为什么停下,更没有记录没有被选择的动作会造成什么结果。Physical AI 的预训练不是把视频切成更多 token 就结束,而是要把观测还原为对行动有用的变量。

因此,Scaling 的第一层含义不是参数更多,而是新增数据仍然带来可测的下游能力增益。若视频量扩大十倍,却只改善场景识别和视觉流畅度,没有减少机器人对齐数据,训练曲线就没有跨越模态边界。第二层含义是复用:一个任务上学到的行为结构能否被下一种本体调用。第三层才是部署:真实运行产生的失败能否修正共享模型,而不是只修补某台机器人的规则。

访谈用内部“GPT-2.5”描述当前模型资源位置,并预期未来出现类似“GPT-3.5”的能力跃迁。这类比喻可以表达团队的研发节奏,却不是行业通用的模型代际,也没有对应公开学习曲线、模型卡或统一评测。它不能回答参数、数据和算力分别增长多少,更不能替代跨任务成功率与适配成本。投资和技术判断应把它视为公司目标,而不是已经发生的能力结论。

公司当前最有价值的信号是组织结构与技术路径一致:姜旭在 OpenAI 参与过 InstructGPT、ChatGPT 和 GPT-4 的预训练、对齐、优化与基础设施,团队同时覆盖数据、模型、算力、硬件和部署。最主要的风险也来自同一结构:语言模型经验能提高训练系统能力,却不能自动提供接触动力学、机器人安全或制造复利。跨领域迁移最终只能由真机数据效率证明。

把路线写成一句可检验的命题,就是:在相同机器人数据预算下,经过大规模人类视频预训练的模型,能否在未见环境、任务和本体上更快达到相同成功率,并在运行中更少需要人工介入。只要比较实验没有回答这句话,视频规模、团队履历和融资都仍是能力的先验概率,而不是能力本身。

02|互联网视频、机器人数据与部署失败不是替代关系,而是三种不同监督

互联网视频最适合提供的是行为覆盖。它包含人如何在拥挤空间移动、如何从语言和场景判断目标、如何接近物体、如何把长任务拆成连续动作,也包含大量失败前兆和社会互动。即使没有精确控制信号,视频仍能教会模型哪些状态通常相邻、哪些对象可以被作用、一个任务大致走到哪一步。公司把视频清洗和处理列为过去一年最大的研发投入之一,说明它把数据工程而非单一网络结构视为预训练瓶颈。

但视频不能承担精确执行监督。关节位置、速度、扭矩、接触力、触觉、摩擦、执行器延迟和控制频率大多不在画面里;相机移动还会与人物动作混在一起。一个人把杯子放稳,视频记录了结果,却未记录抓取力的安全区间。机器人数据的职责因此不是重复教模型什么是杯子,而是把抽象行为映射到本体状态和可执行动作,并校准现实世界的代价。

部署数据又与遥操作示范不同。示范通常偏向成功、动作干净、场景受控;产品运行暴露的是遮挡、传感器漂移、用户打断、意外接触、路径被占用以及系统不知道自己错了。它最稀缺的价值是失败和恢复:哪一步需要人工接管,机器人能否发现偏离,什么安全机制阻止错误扩大。只有这些数据被结构化并回流共享模型,部署才不是售后成本,而是训练资产。

三类数据也对应三种完全不同的合规问题。公开视频需要来源授权、人物隐私和删除机制;机器人对齐数据涉及操作员、场所和设备知识产权;长期交互产品还会记录家庭或办公空间中的敏感信息。若数据权利不能跨产品版本继续使用,数据规模不会自然变成护城河。真正的 Data Scaling 需要同时记录数据量、有效监督密度、使用权和对下游曲线的边际贡献。

合理的训练账本不应只统计小时数,而应为每条样本标记它改变了什么能力。视频数据看对象与行为覆盖、动作可辨识度和相机混杂;机器人数据看状态—动作同步、接触信息和本体多样性;部署数据看失败类型、恢复路径、人工介入和真实任务代价。只有把数据职责分开,团队才能知道下一笔预算应该购买更多预训练覆盖,还是补充某个动作接口。

三层训练分工:每类数据只解决它真正看得见的问题亮源新创路线的关键不是用视频取代机器人数据,而是把不同监督放在最有杠杆的位置,并让后一层的失败反向校准前一层。
01行为预训练层
互联网人类视频
掌握事实
对象、场景、任务进度、可供性、人体运动与社会互动先验
单独使用的失效
缺关节动作、力触觉、奖励和反事实;容易学习相机与外观相关性
⇅
02动作对齐层
遥操作 + 真机轨迹
掌握事实
本体状态、动作坐标、接触、控制频率、动力学与安全约束
单独使用的失效
成本高、覆盖窄、绑定本体;单独扩大容易重复采数
⇅
03部署校准层
失败 + 接管 + 恢复
掌握事实
真实长尾、用户打断、不可恢复错误、运行代价与产品分布
单独使用的失效
若无数据权和结构化回流,只会沉淀为售后工单
01视频预训练是否减少达到同一成功率所需的真机小时02新本体是否只需小型适配器而非重训主干03失败数据是否自动进入评测集和下一轮训练04数据授权是否允许跨版本、跨本体持续复用

03|通用动作表征是整条路线的承重墙

从视频到机器人,中间必须存在一个不依附于具体身体、又保留动作后果的接口。亮源新创把它称为 Universal Action Representations。理想情况下,这个表示至少要拆开三件事:任务意图回答“为什么行动”,环境中的期望变化回答“世界应当怎样改变”,本体映射再回答“这台机器人用哪些关节和控制频率实现变化”。如果三者混成一个 latent,所谓跨本体就会把人类手臂、相机视角或某台机器人的动力学一起记住。

最有意义的抽象单位不是“人的右手向左移动”,而可能是“末端相对目标的位姿变化”“身体质心跨过某个支撑区域”或“保持安全距离并通过狭窄空间”。这类表示能被双足、轮式和四足通过各自控制器解释。可一旦任务进入摩擦、柔性物体和精细接触,身体无关的高层意图还不够,模型必须知道某种硬件能否实现动作,以及动作失败会造成什么后果。通用性因此来自分层,而不是删除本体差异。

Latent Action Pretraining(LAPA)提供了一个重要的行业参照:先从无动作标签视频中学习离散潜动作,用这些潜动作预训练 VLA,再以较少带动作的机器人数据映射到真实控制。结果支持“无标签视频可以成为动作预训练材料”,也暴露关键边界——潜动作首先是画面变化的压缩,不天然等于真实因果动作;背景和相机变化仍可能被误编码。亮源新创若采用不同结构,也必须回答同一组混杂问题。

V-JEPA 2 给出另一种证据。其视觉世界表征先在超过百万小时互联网视频上自监督预训练,随后用不足 62 小时的无标签机器人视频训练动作条件模型,并在 Franka 机械臂上进行目标条件规划。这个结果说明大规模被动视频可以提高机器人规划的样本效率,但仍保留了机器人域对齐阶段。它支持亮源新创的训练分工,却不能证明任意互联网视频都能自动变成跨本体策略。

公司内部同时探索自回归和 Flow Matching,当前更重视自回归预训练的扩展效率。架构选择本身不是决定性差异:自回归适合把序列预测和大规模训练组织成稳定目标,Flow Matching 常用于连续、多峰动作分布;真正应该比较的是同等算力和真机数据下的学习曲线、控制延迟、长时误差与恢复能力。如果更换生成头就显著破坏跨本体表示,说明主干尚未形成稳定动作接口。

访谈还提到位于多个端到端模型之上的 model harness。它可以负责选择、组合或约束不同策略,让移动、交互与安全模块共享高层状态;也可能只是把多个专用模型编排在一起。二者商业含义完全不同:前者可能形成可扩展的模型平台,后者更接近系统工程。判断方式是观察新增能力时究竟复用了共享表征,还是新增了一套数据、模型和规则。

跨本体最强的验证不是同一网络在三台机器人上都能运行,而是适配曲线。应固定任务难度和成功率阈值,记录冻结多少主干参数、增加多少适配参数、采集多少新数据、需要多少人天,并与从头训练或常规 VLA 微调比较。若第二种、第三种本体的边际成本持续下降,Universal Action Representations 才从概念变成资产。

04|为什么先做移动:它是预训练假设最容易被证伪的第一站

亮源新创把首款产品指向具有通用移动、思考和交互能力的轻量级具身智能体。移动优先并不只是避开灵巧手的硬件难度,它与视频预训练的数据分布一致:人体行走、转身、绕行、停靠和跟随在公开视频中大量可见,动作效果主要体现在身体和相机轨迹;手指力、接触点、摩擦和遮挡后的状态则很难从普通视频恢复。

移动也更适合检验跨本体抽象。双足、四足和轮式底盘的低层控制完全不同,但高层任务可以共享目标位置、可通行区域、动态障碍、社交距离和恢复策略。如果同一表征能把“穿过人群去到桌边”映射到不同身体,路线会得到早期强证据。相反,如果能力只在自研硬件和固定路线成立,就说明共享的可能只是导航语义,而非跨本体行为模型。

LightParkour 是当前最具体的公开技术证据。项目从短人类动作种子出发,在物理仿真中扩展地形与运动分布,通过 Real2Sim2Real 训练一个循环深度策略,再部署到 90 cm、18.9 kg、21 个主动关节的 Lightbot 0。项目与论文报告策略以深度视觉、本体感知和速度指令为输入,在机载设备上以 50 Hz 运行,不依赖运行时参考轨迹、技能标签、外部跟踪或离板状态估计。

它证明了团队能把动作参考、物理仿真、感知策略和自研硬件闭成一个工程环,也说明公司不是只做视频研究。然而 LightParkour 的训练证据来自短动作种子、物理建模和仿真随机化,不是访谈所描述的互联网规模视频基础模型;其目标是复杂地形运动,也不是多任务交互智能。把它放在正确位置,结论应是“本体与运动控制能力已出现”,而不是“行为预训练主张已被证明”。

移动产品的商业挑战也不低。传统导航栈已能在结构化场所完成定位、路径规划和避障,基础模型必须在开放指令、未知环境、动态人群、语义目标和失败恢复上提供明显增量。若产品只完成“从 A 到 B”,客户会按底盘、续航和成本采购;只有当系统能理解模糊目标、处理打断并在环境变化中恢复,预训练行为先验才会进入定价。

因此,首代产品 Demo 不应只展示一次流畅行走。更有价值的是在未提前建图或布局变化的环境中,由自然语言给出含歧义目标,中途加入移动障碍和用户改口,并展示机器人如何识别不确定性、请求确认、重新规划、在失败后恢复。还应同时报告百次任务成功率、每小时接管、恢复率、端到端延迟和不同本体适配成本。

移动与灵巧操作:同一种视频预训练假设,会遇到两种完全不同的落地难度“先移动、后操作”不是能力高低排序,而是按观测可见性、本体映射和错误代价选择验证顺序。
比较维度通用移动灵巧操作对亮源路线的含义
公开视频可见性人体轨迹、绕行、跟随和停靠大量可见手指遮挡多,力、触觉和摩擦不可见视频预训练更容易先覆盖移动先验
动作抽象目标、路径、可通行区可跨双足 / 四足 / 轮式共享抓取姿态、自由度和末端结构高度本体相关移动更适合早期验证 Universal Action Representations
低层控制可交给成熟定位、运动与安全控制器接触过程要求高频闭环和精细力控分层系统可先让基础模型负责高层移动决策
错误容忍多次路径可达;常可停下、绕行或重规划滑落、碰撞和损坏可能瞬间不可逆移动能更安全地收集失败与恢复数据
现有竞争传统导航成熟,语义理解与开放环境必须带来增量通用灵巧能力仍稀缺,但数据和硬件成本更高首产品需要证明的不只是行走,而是理解、交互和恢复
决定性指标未见布局成功率、每小时接管、恢复率、跨本体适配天数接触成功率、物体 / 材质泛化、力峰值、长任务完成率先建立同一套跨版本、跨本体评测账本

05|自研硬件不是终局,而是把模型缺失变量暴露出来的实验装置

公司当前同时做模型、算力、数据、硬件和部署,并披露已经开发人形与较低自由度轮式本体,也在第三方本体上做过实验。对一家声称长期提供通用模型的公司,这看似矛盾:如果目标是跨本体,为什么还要自己造机器人?答案在于早期市场没有统一、可观测、可安全修改的参考平台。没有底层控制与传感器权限,团队很难区分模型错误、执行器误差和系统集成问题。

自研本体的合理角色是测量仪器。它应让团队控制时间同步、动作频率、传感器、故障注入和数据回流,快速暴露表示中缺失的变量;一旦接口稳定,外部本体接入成本应下降。若每次模型迭代都必须依赖自有机械、专用零件和创始团队联调,硬件就不再是实验装置,而会把公司锁进垂直整合和制造现金流。

长期开放生态能否成立,取决于接口而非口号。至少需要定义观测规范、形态描述、动作空间、时间同步、安全约束、适配器训练和评测协议。第三方本体厂商愿意接入的条件,是模型能缩短其开发周期、提高开放任务成功率,且不会夺走客户和运行数据。亮源新创尚未公开 SDK、模型许可、适配成本或合作清单,因此开放平台仍是方向,不是已建立的生态。

首款轻量级具身智能体还承担另一项任务:建立类似 ChatGPT 的低摩擦交互入口。语言模型的能力并非在产品出现前完全不可见,但对话界面让用户可以随时提出任务、纠正结果并产生偏好数据。物理智能体若长期存在于同一空间,也能获得上下文、习惯和任务反馈;它的价值可能从单次自动化转向持续协助、环境记忆和主动服务。

这种交互飞轮比网页对话更敏感。机器人会记录空间布局、人员活动与物品位置,也能采取有物理后果的动作。产品必须把数据同意、离线能力、删除权、权限分层、儿童与访客保护以及紧急停止做成系统结构,而不是上线后的隐私条款。模型越能主动行动,越需要清楚区分“可以建议、可以准备、可以执行、必须确认”的权限边界。

商业化最好的首场景未必是任务最复杂的场景,而应同时满足四个条件:移动与交互确有未满足需求;错误可以被安全停止和恢复;用户愿意持续使用并授权反馈;现场分布足够丰富,能改善共享模型。一个封闭、每次都由工程师兜底的展示空间会产生漂亮 Demo,却不能形成可扩展数据资产。

融资和组织扩张提高了执行概率,也提高了验证压力。公司从 2026 年 5 月访谈中的约 60 人增长到 8 月公告中的超过 100 人,并完成数亿元 Pre-A 轮。高密度小团队的叙事将在百人阶段接受新考验:模型、硬件和产品需要共享同一组里程碑,否则每条线都可能有自己的 Demo,却没有一条产品闭环。

管理上最重要的共同指标不是各模块的论文、模型参数或硬件版本,而是端到端学习效率:每个真实失败从发生到进入评测集需要多久;修复是否提高多个本体而非单台样机;一个版本的能力提升是否降低下一客户的部署工时。只有这些指标把模型、数据、硬件和产品绑在一起,全栈才是优势而不是组织负担。

06|把宏大叙事改写成五道证据门:每通过一道,模型才获得更多行动权

亮源新创的路线拥有一套自洽的理论:公开视频提供最大的行为覆盖,人类动作表征承担跨本体翻译,少量机器人数据完成对齐,自研硬件制造闭环,长期交互产品产生部署反馈。它的优势是正面解决机器人数据不可无限扩张的问题,也与创始团队的大模型训练经验相匹配;风险是链条上的每一个箭头都可能损失信息,而任何一处损失都能被下游工程暂时掩盖。

第一道门应验证视频是否学到行为,而不只是外观。需要在未见人物、背景和相机条件下测试任务进度、可供性、动作顺序和零动作识别,并用相机扰动、背景替换和动作交换检查混杂。第二道门验证对齐效率:在同一机器人数据预算下,与无视频预训练、通用视觉预训练和 LAPA / V-JEPA 类基线比较,报告达到相同成功率所需的真机小时。

第三道门是跨本体。固定一组从未参与预训练的任务,分别接入轮式、双足或四足平台,公开冻结参数比例、适配参数量、标定时间和新数据量。若所谓通用动作表示只能在同形态机器人之间迁移,适用范围应被准确限定。第四道门是长期运行:模型必须在传感器噪声、布局变化、打断和失败后恢复,报告连续运行时长、每百小时接管和不可恢复故障。

第五道门才是商业复利。应把第二种本体、第二类任务和第二个独立客户与第一次交付比较,统计全口径工程人天、专用硬件、训练算力、现场支持和单位毛利。客户或硬件伙伴承担的适配成本也必须计入,否则成本只是被转移。只有边际成本下降,基础模型才产生平台效应。

LightParkour 已让公司获得一部分本体工程和运动控制证据,融资与百人团队提供了扩大实验的资源;公开资料仍缺预训练数据构成、模型结构、视频—动作对齐消融、跨本体曲线、产品 SLA 和客户部署。这个证据位置既不应被低估为“只有概念”,也不能被抬高为“通用物理智能已经出现”。更准确的表述是:训练范式明确、工程系统开始形成、核心迁移命题尚待公开验证。

如果路线成功,亮源新创最重要的资产不会是某一代机器人,而是一套让互联网行为知识不断被翻译到新身体的生产机制;每增加一个本体,模型会更懂哪些行为可共享、哪些必须本地校准。如果路线失败,最可能的原因也不是视频不够多,而是人类行为与机器人动作之间不存在足够稳定的低成本接口,导致每次落地仍需大量真机工程。

未来跟踪时,应少问“模型到了 GPT 的哪一代”,多问五个数字:视频预训练节省多少机器人数据,新本体适配需要多少天,未见任务成功率提升多少,每百小时人工接管多少,第二个客户的交付成本下降多少。它们共同回答同一个问题:亮源新创是在训练一个可以复用的 Physical AI 基础模型,还是在为每台机器人重新建设一套智能。

五道证据门:从“看懂人类视频”到“形成基础模型复利”每一道门都对应一个新的系统权限。前一门未通过时,后一门的 Demo 可能只是硬件、规则或人工兜底。
01行为可分离

换人物、背景和相机后,动作顺序与任务进度仍可识别;零动作不被误编码

可主张行为预训练→
02对齐有增益

同等成功率下,视频预训练显著减少机器人数据与训练算力

可主张数据效率→
03跨本体复用

冻结大部分主干,以少量适配数据接入不同形态并保持未见任务能力

可主张通用动作表征→
04长期可恢复

布局变化、打断和失败下,每百小时接管与不可恢复错误持续下降

可进入受限部署→
05交付有复利

第二本体、第二任务和第二客户的全口径边际成本同步下降

可主张基础模型平台
最终判据:不是看过多少视频,而是每多看一批视频、每多接一台机器人,下一次真实行动是否更便宜、更安全、更少依赖人工。
SOURCE

资料来源与核验口径

本文以公开资料中的主要论点、案例与数据为基础,加入本站图解和分析。公司或榜单自报结果按来源标注,无法独立复现的指标不作扩张解释。