苏度:把大模型式能力生产和分发逻辑带入机器人行业
从 60 分钟连续抓取、纯仿真技能训练,到统一底座、分层架构与 Skills API:完整梳理苏度试图把大模型式能力生产和分发逻辑带入机器人行业的路线。
要点速览
- 抓取技能据公司披露完全用仿真数据训练,不依赖真机示范、遥操作和人工标注;同一模型处理不同物体,并以 15—25Hz 根据最新观察闭环更新。
- 公司整体并非排斥真实数据,而是采用虚实融合:仿真负责规模化预训练,真机数据负责修正、对齐、长程行为和部署验证。
- 系统采用分层架构:高层 VLM、推理模型和 Agent 决定做什么,底层 Manipulation Skills 在技能内部端到端闭环执行。
- 最终平台假设是把抓取、放置、开合、插入和柔性物体操作等技能变成机器人时代的 API,让开发者构建上层 Agent 与行业应用。
- 苏度路线最终要证明的不是某个抓取 Demo,而是平台复利是否成立:随着技能、本体和客户增加,数据与模型能否复用,真机校准、人工介入和交付成本能否持续下降;这决定它会成为基础模型平台,还是停留在高成本的项目制集成。
基础模型通过预训练持续生产能力,再由 Agent 和应用进入行业;机器人产业却仍被本体、遥操作、仿真、VLA、世界模型和场景交付分割,基础能力与应用之间尚未形成稳定分工。苏度试图把“统一预训练底座—可复用技能—开发者应用”的结构搬到物理世界。接下来沿着能力生产、系统架构、产品分发和规模化验证这条主线展开。
从能力生产到平台分发
六个章节沿同一条因果链展开:行业问题促成新的数据生产方式,数据支撑训练闭环与技能架构,技能再通过 API 进入应用,最终接受可靠性与规模化检验。
01|行业问题:为什么机器人需要新的能力生产方式
OpenAI、Anthropic、DeepSeek 等基础模型公司的关键价值,不只体现在参数规模和 Benchmark 成绩,更在于它们能够通过预训练和规模化数据不断产生新能力,再把同一底座交给企业和开发者,进入更多产品。
当模型从理解、生成、推理和 Coding 逐渐走向操作计算机,下一个自然问题是它能否进入物理世界,稳定感知环境、操作物体并完成任务。但机器人产业与大模型产业的结构不同:前者仍同时存在本体、遥操作、仿真、VLA、世界模型与场景交付等多条路线,基础能力和应用之间尚未形成稳定分工。
苏度过去较为低调,直到 2026 年 4 月公开高成功率抓取技能,外界才较完整地看到其路线;约三个月后的 WAIC,苏度又展示了十余种底层能力,覆盖开放环境泛化抓放、工业抓取、双手协作、移动操作、精密组装和多机协同。
真正值得关注的不只是抓取分数,而是数据、架构和商业思路共同指向一套新的机器人能力生产函数:改变训练数据的来源,形成统一且可复用的基础技能,再让这些能力与上层 Agent、场景应用形成分工。
规模化数据LLM 使用互联网语料;机器人尝试用可控制、可扩展的仿真数据
↓统一预训练底座能力不再依靠逐条规则或每个任务从头训练
↓Agent 与 Skills高层理解和规划调用稳定的底层操作能力
↓开发者应用行业团队负责工作流、场景知识与最后一公里
02|数据生产:60 分钟抓取真正揭示了什么
苏度在 4 月公开了一段约 60 分钟连续、未剪辑的测试。机器人面对多种陌生物体,首次尝试成功率约 98%,两次尝试内接近 100%。测试对象不仅有普通刚体,也包括柔性、透明、反光和不规则物品;环境还加入光照变化、动态背景、随机物理干扰和障碍约束。
比 98% 这个数字更重要的是能力的获得方式。按苏度公开口径,这一 Picking 策略完全使用仿真数据训练,不依赖真机演示、遥操作或人工标注;不同物体由同一个模型处理,不逐个微调;执行时每一步都读取最新观察,以 15—25Hz 更新动作。
这与常见的真实数据采集路线形成对照。工人佩戴相机、机器人遥操作和真机示范能够记录摩擦、形变、接触与设备误差,这些信息不可替代;但任务一扩张,往往需要更多场景、设备、人员和客户现场数据,还会遇到工艺保密与数据安全。
苏度的假设是把新增能力的主要成本,从线性增加采集人力,转向扩大仿真数据分布和训练算力。如果成立,机器人技能就可能像大模型预训练一样,通过数据规模和计算不断扩展,而不是每个任务都重新组织采集。
这一结果仍有清晰的证据边界:98% 是公司测试口径,完整计分协议与第三方复现尚未公开。它目前更适合用来检验一个关键假设——机器人能力能否摆脱与真实采集成本近似线性增长的关系。
| 维度 | 公开信息 | 它说明什么 |
|---|---|---|
| 测试形式 | 约 60 分钟连续、未剪辑 | 比精选短视频更接近稳定性展示 |
| 对象范围 | 刚性、柔性、透明、反光、不规则物体 | 覆盖部分常见视觉与抓取难点 |
| 环境扰动 | 光照、动态背景、随机物理干扰、障碍 | 测试并非完全静态桌面 |
| 训练数据 | 公司称完全使用仿真,不用真机演示、遥操和人工标注 | 核心假设是降低能力扩张的数据成本 |
| 执行方式 | 同一模型、无需逐物体微调、15—25Hz 闭环 | 每步根据最新观察修正动作 |
03|训练闭环:仿真预训练如何与真机校正配合
大模型带来的深层变化,是把大量能力转化成预训练问题。过去软件能力主要靠工程师写规则,基础模型则先在统一训练中形成语言、知识和推理能力,再通过后训练、工具及业务数据进入具体应用。苏度希望机器人操作也遵循类似路径。
仿真的作用不只是更便宜地生成数据,还能主动控制数据分布。系统可以变化物体几何、材质、光照、背景、障碍、干扰方式和传感器噪声,并针对模型薄弱处制造长尾与对抗条件。真实采集更多是在记录已组织出的场景,仿真则可能成为持续出题的数据机器。
仿真并不能完全替代真实数据。若物理引擎没有覆盖关键接触、形变和执行误差,数据再多也不会自动消除 Sim-to-Real 差距。苏度的完整路线是虚实融合:仿真承担规模化预训练,真机数据负责修正、对齐、长程行为与部署验证。
这对应大模型中的预训练与后训练分工:大规模数据扩展底座,少量高价值数据校准行为。苏度将其定义为一条不同的 scaling curve,但严格的 Scaling Law 需要模型、数据和算力增长与性能之间出现稳定曲线。目前公开证据只说明在 Picking 测试中,纯仿真策略可以迁移到真机。
参数化仿真系统改变几何、材质、光照、背景、障碍和噪声
规模化预训练覆盖常规组合、长尾和对抗条件,形成技能底座
真机校正补充真实摩擦、形变、接触、设备误差和长程行为
部署验证真实任务结果继续校准数据分布与技能边界
04|系统架构:高层推理与底层技能如何分工
“像大模型”不意味着用一个超级网络同时完成目标理解、任务规划和每个关节控制。按公开材料,苏度采用分层系统:上层 VLM、Reasoning Model 和 Agent 理解环境、拆解任务、选择技能;底层 Manipulation Skills 以本地、实时、闭环方式完成抓取、放置等动作。
苏度机器人演示的是这套架构的底层。抓取范围内使用单一闭环策略,每一个控制步读取最新观察;在完整系统中,上层可以在所有需要抓取的任务里调用同一个抓取技能。准确说法因此是:基础技能内部端到端自闭环,完整长任务由多个层级合作完成。
这种选择体现了实时性的客观分工:高层推理可以容忍更长延迟,低层控制必须在几十毫秒内响应现场变化。同一个庞大模型同时承担复杂推理与高频控制,并不必然更合理。
真正决定路线是否通用的,是不同技能能否进入统一模型、共享数据、表征和训练基础。如果抓取、放置、开合、插入、柔性操作每次都重新数采和训练,通用机器人仍只是专用系统的集合;如果新技能能复用基本功,新增能力的边际成本才会下降。
苏度还把世界模型与强化学习一体化作为核心能力:世界模型预测动作后物理世界可能怎样变化,强化学习则利用仿真数据进行策略自我迭代。二者组合的目标,是让机器人既能预判后果,也能持续优化行为。
理解环境、目标、对象和约束
↓拆解任务、选择技能、管理顺序与状态
↓技能内部端到端、实时、闭环执行
↓真实状态回到技能和上层,决定继续、重试或切换
05|产品形态:为什么要把机器人技能做成 API
基础模型公司的价值不只来自模型性能,还来自能力可以被下游开发者调用。同一个语言模型进入编程、客服、搜索和企业流程,是因为模型公司维护底座,开发者负责产品、工作流与行业知识。苏度希望机器人行业也形成这样的层次。
这套体系的底层包括世界模型、机器人本体、Manipulation Foundation Model、仿真训练系统和可调用 Skills;上层则包括 VLM、推理、Agent 与行业应用。其产品逻辑类似苹果生态:硬件与操作系统建立平台,开发者和应用再把平台带进大量场景。
这种产品形态与数据路线相互支持。传统工业项目若必须由供应商进入每个客户现场,采集工艺、工件和生产参数,公司很容易变成重定制方案商,项目越多,交付人员越多,能力也难以跨客户迁移。
如果底层技能足够通用稳定,苏度可以维护硬件、模型、仿真和技能平台,让客户或行业开发者用自己的场景数据完成私有化适配,而不必向平台方交出敏感工艺。这既分担最后一公里数据成本,也可能让更多产业价值留在下游。
这构成苏度与大模型公司最深的相似性:公司价值不再只取决于自己交付了多少项目,而取决于有多少机器人应用可以建立在同一底座上。
| 层级 | 苏度希望提供 | 开发者 / 客户负责 | 潜在价值 |
|---|---|---|---|
| 基础设施 | 本体、仿真、世界模型、基础技能 | 选择硬件和部署方式 | 复用训练与工程底座 |
| 能力接口 | 可调用 Skills、状态与执行反馈 | 组合工作流和异常处理 | 减少每个项目从零开发 |
| 智能层 | 与 VLM、Reasoning、Agent 对接 | 行业知识和任务规划 | 让同一能力进入更多应用 |
| 私有数据 | 提供训练和适配工具 | 保留敏感工艺与场景数据 | 降低数据外流与最后一公里成本 |
06|规模化门槛:从高成功率 Demo 到可复用平台
大模型 API 与机器人 Skills 之间存在重要边界。软件接口的输入、输出和错误码相对清楚;机器人每一步都会改变真实环境,后续动作因此面对新的位置、遮挡、负载和接触条件。同一个技能也会因本体、材质、光照和工位不同而表现变化。
底层技能不仅要输出动作,还必须报告置信度、检测失败、触发重试或恢复,并把执行后的真实状态准确交还给上层 Agent。否则上层会在错误世界状态上继续规划。
长程任务会放大问题。若简单假设每个技能成功率为 98%,20 个步骤没有恢复机制,理论成功率约为 67%;现实误差并不独立,前一步放歪还可能直接改变后一步的输入条件。
平台化需要连续通过四道门:从普通抓取进入插孔、装配、铰链和柔性物体等富接触任务;从单技能成功率走向多技能组合的端到端成功率;建立失败检测、重试、恢复与人工接管;最后证明同一技能能被第三方跨本体、工位和客户低成本复用。
在首次公开抓取 Demo 约三个月后,苏度在 WAIC 把公开能力扩展到十余项,并出现移动中开放环境泛抓取、精细物品抓取、精确放置与组装、双手协作和精密组装等多技能组合。这是能力集合扩张的阶段性信号,但还不能等同于平台化已经完成。
判断这条路线是否成立,最终要看新增技能能否持续共享底座、复用训练并组合执行,以及第二个本体、工位和客户的部署成本是否显著下降。如果每项技能背后仍是独立项目,就不会形成基础设施;如果第三方可以稳定调用、扩展和商业化这些能力,苏度才真正完成从机器人公司到能力平台的跨越。
因此“最像大模型公司”指的不是行业排名,而是能力的生产与分发逻辑:以可扩展数据训练统一底座,以技能接口连接上层应用,再用部署反馈继续改进能力。60 分钟抓取和 WAIC 展示提供了早期证据,富接触任务、长程恢复、跨本体迁移与客户侧 ROI 才是下一阶段必须回答的问题。
插孔、装配、铰链、柔性物体与更复杂接触
CONTACT从单项成功率转向完整任务完成率
SEQUENCE检测、重试、回退、人工接管和状态回传
RECOVERY跨本体、工位和客户,减少长期驻场调试
TRANSFER平台不是技能演示集合
资料来源与核验口径
本文以公开资料中的主要论点、案例与数据为基础,加入本站图解和分析。公司或榜单自报结果按来源标注,无法独立复现的指标不作扩张解释。