Gemini Robotics-ER 2:机器人“大脑”开始从动作生成转向持续监督
它不是更快的 VLA,而是位于 VLA、导航与工具之上的低频认知控制层:持续看视频、拆解长任务、调用执行器并判断何时完成。
要点速览
- ER 2 的关键变化不是把 VLA 做得更大,而是在高频动作控制之上增加一个持续观察、规划、调度和验收的低频认知层。
- 它把长任务闭环写成“接收目标—规划—调用工具或机器人—观察视频反馈—判断进度—失败重规划”,因此真正的产品对象是整段工作流,而非单个动作。
- 连续视频理解与时刻定位是核心:官方报告进度分类 57.4%、关键时刻定位 91.3%、平均时间误差 0.96 秒;这些是预览模型指标,不是生产可用性认证。
- 标准端点适合离线规划、结构化输出和复盘,流式端点适合在线视频监督;工程上应把两者组合,而不是强迫一个端点承担所有职责。
- 安全底座、急停、碰撞与力矩限制仍必须留在确定性的控制器与安全 PLC 中。ER 2 可做语义监督,不能成为唯一安全裁决者。
ER 2 更准确的定位是“机器人认知控制平面”:它不直接接管每一个关节,而是让已有机器人、VLA、导航系统和数字工具在同一任务语义下协作。它的意义不只在于模型能力提升,更在于重新划分机器人系统中规划、执行、监督与安全的职责。
本文的系统架构、闭环流程、端点分工与落地路线分析以这份研究 Slides 为重要基础。可打开完整 PDF,对照查看原始图示与研究脉络。
从认知控制层到可部署机器人系统
七个章节沿着系统设计顺序展开:先明确 ER 2 与 VLA 的职责,再拆解四层架构和闭环执行,随后讨论端点、多机器人、落地路线与安全权限。
01|系统定位:ER 2 不是更大的 VLA,而是上层认知控制面
机器人系统同时面对两个不同时间尺度的问题。高层需要理解任务目标、判断当前进度、选择下一项能力并处理失败;低层需要在毫秒到数秒内输出关节动作或末端位姿,完成抓取、放置、导航等局部技能。把两类问题交给同一个模型,不一定能同时满足推理深度、实时性和安全要求。
ER 2 更接近低频认知控制层:持续接收视频、图像、语言和机器人状态,决定做什么、做到哪一步、是否已经成功;VLA、导航和控制器继续承担动作如何执行。两者不是替代关系,而是高层语义闭环与低层运动闭环的协同。
这种分层改变了平台竞争的重点。模型能力不再只用单次动作成功率衡量,还要看能否管理完整工作流:任务是否被正确拆解,技能是否在正确时刻被调用,失败是否被发现,交接是否完成,最终结果是否满足验收条件。
对现有机器人公司,最短路径不是立即替换底层策略,而是在成熟 VLA 和控制器上增加可观察、可中断、可审计的认知控制面。这样既保留已有运动能力,也能逐步验证高层模型的实际价值。
计划、工具调用、进度、失败与重规划
关节动作、末端位姿、action chunk、局部控制
02|四层架构:让模型、工具、本体和安全边界彼此解耦
ER 2 系统可以拆成四层。第一层是任务指令、摄像头视频、图像、音频、人机交互、机器人状态与环境约束;第二层是基于 Gemini 3.5 Flash 的 ER 2,承担多模态上下文、空间—时间—物理推理、任务规划、进度和成功判断;第三层是函数调用,把子任务交给 VLA Policy、导航 API、机器人技能、搜索或用户自定义工具;第四层才是机器人本体、控制器和仿真环境。
ER 2 的输入上下文约为 131K,输入覆盖文本、图像、视频和音频,输出主要是文本与函数调用,而不是直接生成电机电流。这决定它天然位于感知信息与执行接口之间,而不是运动控制器内部。
分层的价值首先是替换性:更换本体时主要改动能力适配器和底层策略,高层任务语义可以继续复用。其次是可观测性:规划错误、工具选择错误、动作失败和安全拒绝能够分开记录。最后是权限治理:每个工具可以拥有白名单、参数范围、超时、取消和审计,而不必把全部控制权交给生成式模型。
架构真正的难点会从“有没有函数调用”转向接口质量。机器人技能必须声明前置条件、输入输出、持续状态、完成证据、失败码和可取消性;否则高层模型只能调用黑盒动作,无法可靠恢复长任务。
任务指令 · 视频 / 图像 · 音频 · 机器人状态 · 环境约束
统一上下文↓空间 / 时间 / 物理推理 · 任务规划 · 进度与成功判断
文本 + 函数调用↓VLA Policy · 导航 API · 机器人技能 · 搜索 · 自定义工具
受限能力调用↓机器人本体 · 控制器 · 仿真环境 · 现场业务系统
动作 + 状态反馈03|闭环执行:时间判断第一次成为可调用的控制变量
完整闭环从接收任务开始,经过推理与规划、函数调用、动作执行和物理环境变化,再由连续视频把新状态送回 ER 2。模型随后判断进度、关键时刻和成功失败:成功则推进下一项技能或结束,失败和未完成则触发重试、回退或重新规划。
这套闭环解决的不是“机器人能否看懂一帧画面”,而是“任务在时间上发生了什么”。杯子是否已经放下、门是否真正关闭、物体是抓取失败还是仍在运动,都会决定系统应继续、停止还是重试。
官方指标给出了三个不同信号:五档任务进度分类准确率为 57.4%,关键时刻定位准确率为 91.3%,平均绝对时间误差为 0.96 秒。关键时刻定位明显强于粗粒度进度分类,意味着近期更适合先做事件切片、自动验收和失败定位,而不是仅凭进度分类直接驱动高风险动作。
57.4% 是相对领先结果,不是生产就绪证书。落地系统仍需把视频判断与力传感器、控制器状态、对象检测和业务规则联合使用,并记录置信度、重复观察、漏报、误报和人工接管。
适合作为软状态,不应单独触发高风险动作
适合自动切片、验收和故障复盘
决定技能切换与异常响应的时间精度
04|工程接口:标准端点与 Streaming 端点各自承担什么
标准端点 `gemini-robotics-er-2-preview` 支持代码执行、结构化输出、文件搜索、函数调用、搜索和空间推理,更适合复杂任务规划、离线评测、日志复盘和结构化报告。Streaming 端点 `gemini-robotics-er-2-streaming-preview` 通过 Live API 接收双向音视频流并进行低延迟函数调用,更适合实时任务编排、人机交互和连续视频监督。
两个端点共享多模态输入和函数调用能力,但实时端点并不支持代码执行、结构化输出与文件搜索。为了追求“全实时”而把长计划、文档搜索和复杂计算全部塞进 Streaming 循环,会同时放大延迟、上下文漂移、成本与误触发风险。
更合理的工程组合是:Streaming 端点维护当前阶段、异常和短期调度;标准端点负责任务开始前的复杂规划,以及任务结束后的结构化复盘。在线链路只允许短、明确、可取消的调用,离线链路则处理需要更长上下文的分析。
从业者需要把端点选择写进系统 SLO:分别记录 P50/P95 延迟、视频输入成本、工具调用成功率、上下文增长和降级策略,而不是只验证 API 是否能够返回答案。
| 维度 | 标准端点 | Streaming 端点 |
|---|---|---|
| 主要职责 | 复杂规划、离线评测、日志复盘、结构化报告 | 实时编排、人机交互、连续视频监督 |
| 支持能力 | 代码执行、结构化输出、文件搜索、函数调用与搜索 | Live API 双向音视频、低延迟函数调用 |
| 适合频率 | 任务级 / 阶段级 | 观察级 / 事件级 |
| 不应承担 | 高频运动控制与本地安全回路 | 长文档检索、复杂代码执行和全部离线分析 |
| 核心指标 | 计划质量、结构化正确率、成本与复盘覆盖 | P95 延迟、误触发、丢帧、工具调用与降级 |
05|多机器人协作:真正共享的是任务语义,不是动作空间
Apollo 与 Franka Duo 不需要拥有相同关节结构,也不需要共享同一个底层动作模型。高层系统只需理解两台机器分别具备什么能力、当前处于什么状态、对象在哪里、任务何时可以交接以及最终如何验收。
多机器人协作可以拆成三个接口:能力抽象把移动取物、精细操作等动作封装为技能;任务交接维护对象 ID、空间位置、完成证据、错误码和下一步前置条件;统一验收通过多路视频和工具返回值判断整体工作流是否完成。
这种架构允许高层 Agent 跨本体复用,底层 VLA 则继续保留各自最合适的动作表示。平台壁垒因此不只是支持多少种机器人,而是能否在跨工具、跨视频和跨任务阶段时维持一致状态。
第三方接入的最低标准应包括:机器可做什么、何时不可调用、调用是否可取消、执行过程中如何报告状态、完成时提供什么证据、失败后能否安全回退。没有这些协议,多机器人展示仍可能只是预设脚本。
移动取物 / 粗操作
READY → EXECUTING → HANDOFF精细操作 / 双臂协作
WAITING → ACCEPTED → VERIFIED共享语义层可以跨本体复用;关节动作仍由各自 VLA 与控制器负责。
06|落地顺序:先证明看得准,再逐步扩大调度权限
对 VLA 和世界—动作模型平台,最短路径不是立即让 ER 2 接管机器人,而是先把它作为监督器和评测器。连续视频可以输出任务进度、成功、失败和关键时刻,用于抓取、插入、摆放等任务的自动验收,并在失败时给出重试或回退信号。
世界模型可以进一步提供预期视频或预期状态,ER 2 再比较预测与真实执行是否保留关键事件、任务进度和因果结果。评测就不再停留于像素差异,而转向任务语义:关键步骤有没有发生、结果是否满足目标、失败属于哪一类。
P0 阶段只证明“看得准”:建立代表性视频集,报告进度、关键时刻、成功失败、误报、漏报和置信度。P1 阶段证明“评得准”:比较预测视频和真实视频,展示语义差异、自动验收和恢复建议。P2 阶段才证明“调得动”:在独立安全底座下调度两个本体或一个本体加业务 API。
每一阶段都应绑定权限上限。P0 只生成标签和告警,P1 可以提出恢复建议但不直接执行,P2 才允许调用白名单能力。权限随证据扩大,而不是随 Demo 观感扩大。
连续视频 → 进度 / 成功 / 失败 / 关键时刻
准确率 · 误报 · 漏报 · 时间误差
只读:标签、告警、复盘预测视频 ↔ 真实视频 → 任务语义差异
关键事件保留 · 失败分类 · 人工复核节省
建议:重试、回退、人工接管跨两种本体或本体 + 业务 API 完成长任务
端到端成功 · 恢复 · 成本 · 安全降级
受限执行:白名单工具调用07|部署边界:模型负责认知建议,安全系统保留最终否决权
ER 2 适合优先进入执行监督、自动验收、仿真与真机视频评测,以及非关键流程的工具调度。它不能替代高频运动控制、力觉闭环、急停、碰撞检测、力矩限制、安全区域、人体检测和安全 PLC。
模型能够识别语义风险,例如人员靠近、任务状态异常或工具使用不符合指令,但生成式模型仍可能出现幻觉、延迟、提示词敏感和分布外失效,网络与 API 也可能中断。因此模型可以触发停机或请求澄清,却不能取消本地安全条件。
完整安全栈至少包括四层:硬件层负责急停、限位和制动;控制层负责速度、力矩、碰撞和区域状态机;能力层负责工具白名单、参数范围、身份与审计;语义层负责理解任务风险、人员接近和异常上下文。越靠近物理执行,规则越确定,生成式模型权限越低。
真正上线前还要处理视频与音频中的个人信息、告知与同意、数据保留、跨境、训练使用、日志脱敏和删除机制。安全与隐私不是模型外部的法务附件,而是决定系统能否进入家庭、工厂和公共空间的产品组成部分。
资料来源与核验口径
本文以公开资料中的主要论点、案例与数据为基础,加入本站图解和分析。公司或榜单自报结果按来源标注,无法独立复现的指标不作扩张解释。