> 来源：UsefulAI（实用 AI / Useful AI）— https://usefulai.cloud/insights/bridgevla-plus-plus/
> 作者：CarryChang · 最近更新：2026-09-13 · 语言：zh-CN

[实用 AI 指南](https://usefulai.cloud/) › [深度阅读](https://usefulai.cloud/insights/)

BridgeVLA++
3D 操作
VLA
时空记忆

# 一个框架同时吃掉 3D 操作的三个老大难——BridgeVLA++ 的务实解法

机器人 3D 操作（manipulation）领域这两年的主流打法是把基座模型做得更大。BridgeVLA++（中国科学院 + 字节跳动 Seed）反过来做了一件「不酷」但务实的事：冻住原有的 PaliGemma 3B 骨干网络不动，只额外挂上一个约 2.7 亿参数、约 9.2% 开销的时空记忆模块，就把记忆依赖型任务的成功率从 18.9% 拉到 96.0%。我认为这篇论文的价值不在排行榜数字，而在于它证明了「给对地方打补丁」有时比「把整个模型做大」性价比更高。

**我的立场：**这篇论文最值得关注的不是它刷新了榜单，是它选择的修复方式——不动基座模型，只在旁边加一个小而精准的记忆模块。这代表一种和「继续堆大模型」完全相反的技术路线，如果这个模式能被验证具有普适性，会显著降低小团队参与机器人 3D 操作研究的门槛。

### 3D 操作领域的三个老大难

把 3D 感知信号接入视觉语言模型（VLM）做机器人动作预测，长期存在三个难点：**3D 输入和 2D 预训练的视觉语言模型天然不对齐**（点云数据和 VLM 习惯处理的 2D 图像在表示空间上不一致，直接接入效率低）；**动作预测缺乏统一的输出空间**（不同任务的动作表示方式五花八门，模型很难复用同一套预测机制）；**需要记住任务早期发生的事情时严重失效**（大多数 3D VLA 模型是「无记忆」的，只看当前这一帧做决策，遇到需要参照几步之前场景状态的任务就会崩）。前两个问题在前作 BridgeVLA 里已经通过「把 3D 输入投影成多视角 2D 图像、用 2D 热力图统一动作预测」的方式解决；BridgeVLA++ 要补的是第三个——记忆缺失。

### 务实解法：不动骨干网络，只加一个记忆模块

BridgeVLA++ 的做法是保留 BridgeVLA 冻结的 PaliGemma 3B 骨干网络，额外挂上一个**时空记忆模块**，参数量约 2.6977 亿，相当于给 3B 规模的骨干网络增加约 9.2% 的开销——不是重新训练一个更大的模型，是精准地在旁边加一块专门处理记忆的组件。这个模块包含两部分：**时间记忆**（缓存锚点视角、相邻关键帧、自适应选取的子目标关键帧）和**空间记忆**（在当前精细操作阶段的相机视角下，重新渲染任务开始时的初始点云）。这套组合让模型在执行到任务后期时，仍能「回头看」任务早期的场景状态，而不是只依赖当前这一帧的信息做判断。

### 务实到什么程度：具体数字说话

论文报告 BridgeVLA++ 在 RLBench 上平均成功率达到 **93.7%**（基线 BridgeVLA 为 90.5%），在存在分布偏移的 COLOSSEUM 基准上达到 **65.2%**——这两项提升幅度不算惊艳，说明记忆模块对「不特别依赖记忆」的常规任务帮助有限。真正的差异出现在**专门测试记忆依赖能力的 RMBench**（双臂、需要记住早期状态的基准）：无记忆的 BridgeVLA 只能拿到 **18.9%**，加上记忆模块的 BridgeVLA++ 跳到 **96.0%**；单臂的 MemoryBench 上更是达到 **99.7%**。真机测试用 Franka Research 3 和 Dobot CR5A 两款机械臂，每个任务只用 **10 条示教演示**就完成验证。**这个数据分布本身就是最有说服力的论证**：记忆模块几乎不影响常规任务的表现，但在真正需要记忆的任务上带来了接近五倍的提升，说明这个补丁精准地打在了问题的根子上，不是靠整体堆参数换来的普遍性提升。

评论员视角
务实之外，这篇论文也有需要如实说的代价。**推理速度从每步 0.35 秒降到 0.57 秒**（RTX 4090 上测得），对需要快速反应的实时控制场景不是免费的午餐；缓存关键帧的槽位数量需要按具体基准手动调优（RMBench 上设为 12，其他场景设为 2），这意味着把这个记忆模块直接「插拔」到全新任务上未必是零成本的，调参本身仍需要经验。真机验证虽然用了两款真实机械臂，但场景是为了公平对比手动复现的实验室环境，不是开放世界的压力测试——论文里也没有和商业闭源 VLA 模型的直接对比，长时间跨度、面对全新物体时的失效表现也没有详细披露。

但即便有这些局限，我认为这篇论文指出的方向值得关注：**把预训练好的 VLM 当作固定底座，只在记忆、动作头、对齐这些外围组件上做文章**，这条路线如果继续被验证有效，会实质性降低小团队参与机器人操作研究的门槛——不需要重新训练一个基座模型，只需要在别人训好的底座上做精准的外科手术式改进。这和过去两年机器人研究普遍依赖「把基座做得更大」的主流路线是相反的方向，值得继续观察是否能推广到记忆模块之外的其他能力缺陷上。

#### 关键数据

- 记忆模块约 2.7 亿参数，占 3B 骨干约 9.2% 开销

- RLBench 93.7%（基线 90.5%），COLOSSEUM 65.2%

- RMBench 从 18.9% 跳到 96.0%，MemoryBench 达 99.7%

- 真机测试：Franka Research 3 / Dobot CR5A，每任务 10 条示教

#### 我持保留意见的地方

- 推理耗时从 0.35 秒/步增至 0.57 秒/步，实时控制场景不是免费的

- 缓存槽位数量需按基准手动调优，非真正意义上的即插即用

- 真机验证是受控实验室场景，缺少开放世界压力测试与闭源模型对比

## 继续阅读

[如何从零构建你自己的大语言模型：GPT 和 Claude 背后的 5 阶段流水线 → 所有前沿模型都由同样的五个阶段构建：数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架，你就不会再把模型当作魔法。](https://usefulai.cloud/insights/how-llms-are-built/)
[Anthropic 工程师：我们日常如何使用 Claude Code → 用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿，再把验证流程做进 React 组件和浏览器。](https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/)
[深度阅读 → 15 篇 AI 长文的完整中文解读：Claude Code、Skill、Agent、大模型原理、LLM 资源地图。](https://usefulai.cloud/insights/)
