图谱首页/深度洞察/模型架构网站更新于 2026-08-01
INSIGHT / 03
模型架构

Gemini Robotics-ER 2:机器人“大脑”开始从动作生成转向持续监督

它不是更快的 VLA,而是位于 VLA、导航与工具之上的低频认知控制层:持续看视频、拆解长任务、调用执行器并判断何时完成。

READ THIS FIRST

要点速览

  1. ER 2 的关键变化不是把 VLA 做得更大,而是在高频动作控制之上增加一个持续观察、规划、调度和验收的低频认知层。
  2. 它把长任务闭环写成“接收目标—规划—调用工具或机器人—观察视频反馈—判断进度—失败重规划”,因此真正的产品对象是整段工作流,而非单个动作。
  3. 连续视频理解与时刻定位是核心:官方报告进度分类 57.4%、关键时刻定位 91.3%、平均时间误差 0.96 秒;这些是预览模型指标,不是生产可用性认证。
  4. 标准端点适合离线规划、结构化输出和复盘,流式端点适合在线视频监督;工程上应把两者组合,而不是强迫一个端点承担所有职责。
  5. 安全底座、急停、碰撞与力矩限制仍必须留在确定性的控制器与安全 PLC 中。ER 2 可做语义监督,不能成为唯一安全裁决者。

ER 2 更准确的定位是“机器人认知控制平面”:它不直接接管每一个关节,而是让已有机器人、VLA、导航系统和数字工具在同一任务语义下协作。它的意义不只在于模型能力提升,更在于重新划分机器人系统中规划、执行、监督与安全的职责。

COMPANION DECKGemini Robotics-ER 2 研究 Slides

本文的系统架构、闭环流程、端点分工与落地路线分析以这份研究 Slides 为重要基础。可打开完整 PDF,对照查看原始图示与研究脉络。

57.4%进度分类准确率官方基准;预览阶段
91.3%关键时刻定位平均时间误差 0.96 秒
0.96s关键时刻误差平均绝对时间误差
131K输入上下文覆盖文本、图像、视频与音频
ONE CONTINUOUS ARGUMENT

从认知控制层到可部署机器人系统

七个章节沿着系统设计顺序展开:先明确 ER 2 与 VLA 的职责,再拆解四层架构和闭环执行,随后讨论端点、多机器人、落地路线与安全权限。

01|系统定位:ER 2 不是更大的 VLA,而是上层认知控制面

机器人系统同时面对两个不同时间尺度的问题。高层需要理解任务目标、判断当前进度、选择下一项能力并处理失败;低层需要在毫秒到数秒内输出关节动作或末端位姿,完成抓取、放置、导航等局部技能。把两类问题交给同一个模型,不一定能同时满足推理深度、实时性和安全要求。

ER 2 更接近低频认知控制层:持续接收视频、图像、语言和机器人状态,决定做什么、做到哪一步、是否已经成功;VLA、导航和控制器继续承担动作如何执行。两者不是替代关系,而是高层语义闭环与低层运动闭环的协同。

这种分层改变了平台竞争的重点。模型能力不再只用单次动作成功率衡量,还要看能否管理完整工作流:任务是否被正确拆解,技能是否在正确时刻被调用,失败是否被发现,交接是否完成,最终结果是否满足验收条件。

对现有机器人公司,最短路径不是立即替换底层策略,而是在成熟 VLA 和控制器上增加可观察、可中断、可审计的认知控制面。这样既保留已有运动能力,也能逐步验证高层模型的实际价值。

双时间尺度控制:认知闭环与动作闭环ER 2 决定何时调用哪种能力,VLA 与控制器决定动作如何完成;安全底座对两者保留最终否决权。
SLOW LOOP / SEMANTICER 2 / 认知控制层任务级 · 阶段级
核心问题做什么、做到哪一步、是否成功?
主要输出

计划、工具调用、进度、失败与重规划

FAST LOOP / PHYSICALVLA / 动作执行层毫秒级 · 动作级
核心问题下一段动作如何执行?
主要输出

关节动作、末端位姿、action chunk、局部控制

计划 / 状态⇅结果 / 异常
INDEPENDENT SAFETY BASE急停、碰撞检测、力矩限制、安全区域与安全 PLC 独立运行最终否决权

02|四层架构:让模型、工具、本体和安全边界彼此解耦

ER 2 系统可以拆成四层。第一层是任务指令、摄像头视频、图像、音频、人机交互、机器人状态与环境约束;第二层是基于 Gemini 3.5 Flash 的 ER 2,承担多模态上下文、空间—时间—物理推理、任务规划、进度和成功判断;第三层是函数调用,把子任务交给 VLA Policy、导航 API、机器人技能、搜索或用户自定义工具;第四层才是机器人本体、控制器和仿真环境。

ER 2 的输入上下文约为 131K,输入覆盖文本、图像、视频和音频,输出主要是文本与函数调用,而不是直接生成电机电流。这决定它天然位于感知信息与执行接口之间,而不是运动控制器内部。

分层的价值首先是替换性:更换本体时主要改动能力适配器和底层策略,高层任务语义可以继续复用。其次是可观测性:规划错误、工具选择错误、动作失败和安全拒绝能够分开记录。最后是权限治理:每个工具可以拥有白名单、参数范围、超时、取消和审计,而不必把全部控制权交给生成式模型。

架构真正的难点会从“有没有函数调用”转向接口质量。机器人技能必须声明前置条件、输入输出、持续状态、完成证据、失败码和可取消性;否则高层模型只能调用黑盒动作,无法可靠恢复长任务。

ER 2 四层认知—执行系统栈右侧安全轨与模型生成链路并行,任何动作都必须通过本地确定性检查。
01多模态输入

任务指令 · 视频 / 图像 · 音频 · 机器人状态 · 环境约束

统一上下文↓
02ER 2 认知层

空间 / 时间 / 物理推理 · 任务规划 · 进度与成功判断

文本 + 函数调用↓
03工具与能力层

VLA Policy · 导航 API · 机器人技能 · 搜索 · 自定义工具

受限能力调用↓
04动作执行层

机器人本体 · 控制器 · 仿真环境 · 现场业务系统

动作 + 状态反馈

03|闭环执行:时间判断第一次成为可调用的控制变量

完整闭环从接收任务开始,经过推理与规划、函数调用、动作执行和物理环境变化,再由连续视频把新状态送回 ER 2。模型随后判断进度、关键时刻和成功失败:成功则推进下一项技能或结束,失败和未完成则触发重试、回退或重新规划。

这套闭环解决的不是“机器人能否看懂一帧画面”,而是“任务在时间上发生了什么”。杯子是否已经放下、门是否真正关闭、物体是抓取失败还是仍在运动,都会决定系统应继续、停止还是重试。

官方指标给出了三个不同信号:五档任务进度分类准确率为 57.4%,关键时刻定位准确率为 91.3%,平均绝对时间误差为 0.96 秒。关键时刻定位明显强于粗粒度进度分类,意味着近期更适合先做事件切片、自动验收和失败定位,而不是仅凭进度分类直接驱动高风险动作。

57.4% 是相对领先结果,不是生产就绪证书。落地系统仍需把视频判断与力传感器、控制器状态、对象检测和业务规则联合使用,并记录置信度、重复观察、漏报、误报和人工接管。

从任务指令到失败重规划的八步闭环低频认知循环包围高频动作循环;三个时间指标分别对应阶段、事件与时间误差,不能相互替代。
01接收任务→
02推理与规划→
03函数调用→
04动作执行→
05环境变化→
06连续视频→
07进度与成败→
08推进 / 重试 / 重规划
失败或未完成 ↺ 返回规划
57.4%进度分类

适合作为软状态,不应单独触发高风险动作

91.3%关键时刻定位

适合自动切片、验收和故障复盘

0.96s平均时间误差

决定技能切换与异常响应的时间精度

04|工程接口:标准端点与 Streaming 端点各自承担什么

标准端点 `gemini-robotics-er-2-preview` 支持代码执行、结构化输出、文件搜索、函数调用、搜索和空间推理,更适合复杂任务规划、离线评测、日志复盘和结构化报告。Streaming 端点 `gemini-robotics-er-2-streaming-preview` 通过 Live API 接收双向音视频流并进行低延迟函数调用,更适合实时任务编排、人机交互和连续视频监督。

两个端点共享多模态输入和函数调用能力,但实时端点并不支持代码执行、结构化输出与文件搜索。为了追求“全实时”而把长计划、文档搜索和复杂计算全部塞进 Streaming 循环,会同时放大延迟、上下文漂移、成本与误触发风险。

更合理的工程组合是:Streaming 端点维护当前阶段、异常和短期调度;标准端点负责任务开始前的复杂规划,以及任务结束后的结构化复盘。在线链路只允许短、明确、可取消的调用,离线链路则处理需要更长上下文的分析。

从业者需要把端点选择写进系统 SLO:分别记录 P50/P95 延迟、视频输入成本、工具调用成功率、上下文增长和降级策略,而不是只验证 API 是否能够返回答案。

两种端点的能力边界与职责分配能力支持项来自 PPT 与 API 资料;部署建议强调在线链路短决策、离线链路深分析。
维度标准端点Streaming 端点
主要职责复杂规划、离线评测、日志复盘、结构化报告实时编排、人机交互、连续视频监督
支持能力代码执行、结构化输出、文件搜索、函数调用与搜索Live API 双向音视频、低延迟函数调用
适合频率任务级 / 阶段级观察级 / 事件级
不应承担高频运动控制与本地安全回路长文档检索、复杂代码执行和全部离线分析
核心指标计划质量、结构化正确率、成本与复盘覆盖P95 延迟、误触发、丢帧、工具调用与降级

05|多机器人协作:真正共享的是任务语义,不是动作空间

Apollo 与 Franka Duo 不需要拥有相同关节结构,也不需要共享同一个底层动作模型。高层系统只需理解两台机器分别具备什么能力、当前处于什么状态、对象在哪里、任务何时可以交接以及最终如何验收。

多机器人协作可以拆成三个接口:能力抽象把移动取物、精细操作等动作封装为技能;任务交接维护对象 ID、空间位置、完成证据、错误码和下一步前置条件;统一验收通过多路视频和工具返回值判断整体工作流是否完成。

这种架构允许高层 Agent 跨本体复用,底层 VLA 则继续保留各自最合适的动作表示。平台壁垒因此不只是支持多少种机器人,而是能否在跨工具、跨视频和跨任务阶段时维持一致状态。

第三方接入的最低标准应包括:机器可做什么、何时不可调用、调用是否可取消、执行过程中如何报告状态、完成时提供什么证据、失败后能否安全回退。没有这些协议,多机器人展示仍可能只是预设脚本。

跨本体协作的语义交接协议本体保留各自动作空间,高层只共享能力、对象、状态、交接与验收。
SOURCE EMBODIMENTApollo

移动取物 / 粗操作

READY → EXECUTING → HANDOFF
状态上报 →语义交接总线→ 能力调用
能力声明对象 ID空间坐标任务状态失败码完成证据
高层共享任务协议,不共享关节动作
TARGET EMBODIMENTFranka Duo

精细操作 / 双臂协作

WAITING → ACCEPTED → VERIFIED

共享语义层可以跨本体复用;关节动作仍由各自 VLA 与控制器负责。

06|落地顺序:先证明看得准,再逐步扩大调度权限

对 VLA 和世界—动作模型平台,最短路径不是立即让 ER 2 接管机器人,而是先把它作为监督器和评测器。连续视频可以输出任务进度、成功、失败和关键时刻,用于抓取、插入、摆放等任务的自动验收,并在失败时给出重试或回退信号。

世界模型可以进一步提供预期视频或预期状态,ER 2 再比较预测与真实执行是否保留关键事件、任务进度和因果结果。评测就不再停留于像素差异,而转向任务语义:关键步骤有没有发生、结果是否满足目标、失败属于哪一类。

P0 阶段只证明“看得准”:建立代表性视频集,报告进度、关键时刻、成功失败、误报、漏报和置信度。P1 阶段证明“评得准”:比较预测视频和真实视频,展示语义差异、自动验收和恢复建议。P2 阶段才证明“调得动”:在独立安全底座下调度两个本体或一个本体加业务 API。

每一阶段都应绑定权限上限。P0 只生成标签和告警,P1 可以提出恢复建议但不直接执行,P2 才允许调用白名单能力。权限随证据扩大,而不是随 Demo 观感扩大。

P0—P2:能力证据与系统权限同步升级每一阶段同时定义 Demo、指标和允许权限,避免模型尚未验证就进入高风险控制链。
阶段 / 能力命题投资人 Demo必须报告的证据权限上限
P0看得准

连续视频 → 进度 / 成功 / 失败 / 关键时刻

准确率 · 误报 · 漏报 · 时间误差

只读:标签、告警、复盘
P1评得准

预测视频 ↔ 真实视频 → 任务语义差异

关键事件保留 · 失败分类 · 人工复核节省

建议:重试、回退、人工接管
P2调得动

跨两种本体或本体 + 业务 API 完成长任务

端到端成功 · 恢复 · 成本 · 安全降级

受限执行:白名单工具调用
证据成熟度→权限只能随验证证据逐级扩大→物理风险

07|部署边界:模型负责认知建议,安全系统保留最终否决权

ER 2 适合优先进入执行监督、自动验收、仿真与真机视频评测,以及非关键流程的工具调度。它不能替代高频运动控制、力觉闭环、急停、碰撞检测、力矩限制、安全区域、人体检测和安全 PLC。

模型能够识别语义风险,例如人员靠近、任务状态异常或工具使用不符合指令,但生成式模型仍可能出现幻觉、延迟、提示词敏感和分布外失效,网络与 API 也可能中断。因此模型可以触发停机或请求澄清,却不能取消本地安全条件。

完整安全栈至少包括四层:硬件层负责急停、限位和制动;控制层负责速度、力矩、碰撞和区域状态机;能力层负责工具白名单、参数范围、身份与审计;语义层负责理解任务风险、人员接近和异常上下文。越靠近物理执行,规则越确定,生成式模型权限越低。

真正上线前还要处理视频与音频中的个人信息、告知与同意、数据保留、跨境、训练使用、日志脱敏和删除机制。安全与隐私不是模型外部的法务附件,而是决定系统能否进入家庭、工厂和公共空间的产品组成部分。

机器人安全栈:越接近物理世界,生成式模型权限越低ER 2 位于语义监督层,可以建议停止和降级;硬件与控制安全拥有不可绕过的最终决定权。
生成式判断较多权限随接近物理执行而收紧确定性规则较多
01语义监督ER 2

任务风险、人员接近、异常与澄清

建议 / 告警
02能力权限工具网关

白名单、参数范围、身份、超时与审计

允许 / 拒绝调用
03控制安全本地控制器

碰撞、速度、力矩、安全区与故障状态机

实时限制 / 降级
04硬件安全安全 PLC / 机械系统

急停、限位、制动与断能

最终否决
不可绕过原则上层模型可以请求停止,但不能取消下层安全条件。
SOURCE

资料来源与核验口径

本文以公开资料中的主要论点、案例与数据为基础,加入本站图解和分析。公司或榜单自报结果按来源标注,无法独立复现的指标不作扩张解释。