> 来源：UsefulAI（实用 AI / Useful AI）— https://usefulai.cloud/insights/google-gemini-robotics-er2/
> 作者：CarryChang · 最近更新：2026-09-13 · 语言：zh-CN

[实用 AI 指南](https://usefulai.cloud/) › [深度阅读](https://usefulai.cloud/insights/)

Gemini Robotics ER 2
具身推理
安全性

# Google 用 ER 2 做了一件「不酷」的事，但可能做对了

2026 年 7 月 30 日，Google DeepMind 同时发布了 Gemini Robotics 2、Gemini Robotics ER 2、Gemini Robotics On-Device 2 三个模型。宣传素材里最吸睛的是人形机器人 Apollo 2 和机械臂协同作业的演示视频，但我认为这次发布里真正值得关注的，是一件不适合拍进演示视频的「不酷」的事——ER 2 把大量精力投入到安全指令遵循和人体距离感知这两项枯燥的安全基准上，安全指令遵循准确率从上一代的 47.2% 跳到 97.9%。这个选择在具身智能这个热衷于秀"能做什么"的领域里，是一个反直觉的优先级排序。

**我的立场：**具身智能领域的发布节奏普遍是"能力优先"——先秀灵活的手指、协同的多机器人、复杂的多步任务，安全性能是事后补的一句话。ER 2 这次的数据分布反过来：一些面向能力的指标（比如进度分类）提升有限，安全相关指标的提升幅度远超其他任何一项。我认为这才是"可能做对了"的地方——机器人一旦进入有人共处的真实物理空间，安全性不是锦上添花的加分项，是能不能规模化部署的前提条件，这个优先级排序比任何一个具体的性能数字都重要。

### ER 2 是什么：机器人的"高层大脑"，不直接控制电机

Gemini Robotics ER 2（Embodied Reasoning，具身推理）是一个专门负责"思考"而不负责"动手"的模型——它接收连续视频、音频、文本输入，对物理场景进行推理，规划多步骤任务，然后把具体的执行动作交给下层的视觉-语言-动作模型（VLA）或人类远程操作员去完成。可以把它理解成站在机器人旁边的项目经理，不亲自搬东西，但决定接下来该搬哪个、怎么搬、什么时候算搬完。它取代了 2026 年 4 月发布的 ER 1.6，同批还发布了负责实际动作执行的 Gemini Robotics 2（全身人形控制）和离线版 Gemini Robotics On-Device 2。

### 能力数字：有提升，但没有夸张到不真实

在成功检测（图像/视频判断任务是否完成）、具身推理问答（ERQA）、通用仪表读数这几项能力型基准上，ER 2 相比同批对比模型（包括 Opus 5、GPT 5.6 Sol、上一代 ER 1.6）都拿到了最高分，但提升幅度总体温和，多数在 4-13 个百分点之间。**进度分类（判断任务完成到了百分之几）准确率是 57.4%**——这个数字单看不高，但报告说明这已经是同批对比模型里的最高分，说明这类"持续追踪任务进展"的能力，目前全行业都还没做到能拿出手的水平。**精准时刻定位（判断关键动作发生的确切帧）准确率 91.3%，平均误差 0.96 秒，执行速度是上一代的 4 倍**——这是本次更新里少数几个数字既好看、又有实际意义的指标，因为它直接决定机器人能不能在正确的瞬间停止一个动作（比如倒咖啡时准确判断该停手的那一刻）。

### 真正的反差：安全性指标的提升幅度远超能力性指标

这是我认为最该被拎出来单独说的一组数据：**安全指令遵循准确率，ER 2 达到 97.9%，而上一代 ER 1.6 只有 47.2%**——不到 50% 意味着上一代模型对"哪些指令不该执行"的判断基本等于随机；**人体近距离感知（1 米内）准确率，ER 2 达到 93.0%，上一代只有 51.1%**。相比之下，同批对比的 Opus 5 和 GPT 5.6 Sol 在这两项上的分数（95.9%/91.4% 和 77.1%/83.4%）本来就不低，ER 2 这次是在一个别人已经做得不错的维度上，把自己从明显落后拉到全面领先。**安全性指标从"及格线以下"跳到"全场最高"，这个提升幅度和优先级投入，远超任何一项能力型指标的进步**。DeepMind 还专门引入了一个新基准 ASIMOV-Agentic，测试模型是否会拒绝执行下层 VLA 发出的不安全工具调用，以及是否知道该在什么时候向人求助而不是自己瞎猜。

评论员视角
「不酷」这个判断的依据是：安全指令遵循、人体距离感知这类指标，天生不适合做成演示视频里的高光时刻——没有人会为"机器人正确地没有撞到人"这件事鼓掌，但这恰恰是机器人能不能被允许进入家庭、工厂、医院这些有人共处空间的前提。**具身智能行业过去一年的注意力，明显更多投向"能不能做复杂动作"，而不是"会不会在意外情况下做错事"**，ER 2 这次的数据分布是少数几个把资源明确投向后者的信号。

但我也要提一个不该被忽略的警示：**57.4% 的进度分类准确率，报告自己也承认这不是一个适合无监督运行在工厂产线上的数字**。「同批最佳」和「可靠到能放手不管」是两个完全不同的标准，这中间的差距，恰怕才是接下来十二个月具身智能领域真正的看点——不是又出了哪个更炫的演示视频，是这类基础可靠性指标能不能追上安全性指标的进步速度。目前 ER 2 的开放程度也值得注意：它是整个 Gemini Robotics 系列里唯一一个可以通过 Gemini API 直接调用、不需要排队等合作伙伴资格的模型，负责实际动作执行的 VLA 模型仍然只对合作伙伴开放，这个开放节奏差异本身也是一个值得持续观察的信号。

#### 关键数据

- 安全指令遵循：47.2% → 97.9%；人体近距感知：51.1% → 93.0%

- 精准时刻定位 91.3%，误差 0.96 秒，速度为上一代 4 倍

- 进度分类准确率 57.4%，同批最高但报告自认不适合无监督部署

- 唯一通过 Gemini API 开放调用的具身推理模型，VLA 执行模型仍需合作资格

#### 我的判断

- 安全性指标提升幅度远超能力型指标，是反直觉但正确的优先级排序

- 「同批最佳」不等于「可靠到能放手不管」，中间的差距才是真正看点

- 安全性能拍不出炫酷演示视频，但是规模化部署的真正前提

## 继续阅读

[如何从零构建你自己的大语言模型：GPT 和 Claude 背后的 5 阶段流水线 → 所有前沿模型都由同样的五个阶段构建：数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架，你就不会再把模型当作魔法。](https://usefulai.cloud/insights/how-llms-are-built/)
[Anthropic 工程师：我们日常如何使用 Claude Code → 用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿，再把验证流程做进 React 组件和浏览器。](https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/)
[深度阅读 → 15 篇 AI 长文的完整中文解读：Claude Code、Skill、Agent、大模型原理、LLM 资源地图。](https://usefulai.cloud/insights/)
