一个框架同时吃掉 3D 操作的三个老大难——BridgeVLA++ 的务实解法
机器人 3D 操作(manipulation)领域这两年的主流打法是把基座模型做得更大。BridgeVLA++(中国科学院 + 字节跳动 Seed)反过来做了一件「不酷」但务实的事:冻住原有的 PaliGemma 3B 骨干网络不动,只额外挂上一个约 2.7 亿参数、约 9.2% 开销的时空记忆模块,就把记忆依赖型任务的成功率从 18.9% 拉到 96.0%。我认为这篇论文的价值不在排行榜数字,而在于它证明了「给对地方打补丁」有时比「把整个模型做大」性价比更高。
我的立场:这篇论文最值得关注的不是它刷新了榜单,是它选择的修复方式——不动基座模型,只在旁边加一个小而精准的记忆模块。这代表一种和「继续堆大模型」完全相反的技术路线,如果这个模式能被验证具有普适性,会显著降低小团队参与机器人 3D 操作研究的门槛。
3D 操作领域的三个老大难
把 3D 感知信号接入视觉语言模型(VLM)做机器人动作预测,长期存在三个难点:3D 输入和 2D 预训练的视觉语言模型天然不对齐(点云数据和 VLM 习惯处理的 2D 图像在表示空间上不一致,直接接入效率低);动作预测缺乏统一的输出空间(不同任务的动作表示方式五花八门,模型很难复用同一套预测机制);需要记住任务早期发生的事情时严重失效(大多数 3D VLA 模型是「无记忆」的,只看当前这一帧做决策,遇到需要参照几步之前场景状态的任务就会崩)。前两个问题在前作 BridgeVLA 里已经通过「把 3D 输入投影成多视角 2D 图像、用 2D 热力图统一动作预测」的方式解决;BridgeVLA++ 要补的是第三个——记忆缺失。
务实解法:不动骨干网络,只加一个记忆模块
BridgeVLA++ 的做法是保留 BridgeVLA 冻结的 PaliGemma 3B 骨干网络,额外挂上一个时空记忆模块,参数量约 2.6977 亿,相当于给 3B 规模的骨干网络增加约 9.2% 的开销——不是重新训练一个更大的模型,是精准地在旁边加一块专门处理记忆的组件。这个模块包含两部分:时间记忆(缓存锚点视角、相邻关键帧、自适应选取的子目标关键帧)和空间记忆(在当前精细操作阶段的相机视角下,重新渲染任务开始时的初始点云)。这套组合让模型在执行到任务后期时,仍能「回头看」任务早期的场景状态,而不是只依赖当前这一帧的信息做判断。
务实到什么程度:具体数字说话
论文报告 BridgeVLA++ 在 RLBench 上平均成功率达到 93.7%(基线 BridgeVLA 为 90.5%),在存在分布偏移的 COLOSSEUM 基准上达到 65.2%——这两项提升幅度不算惊艳,说明记忆模块对「不特别依赖记忆」的常规任务帮助有限。真正的差异出现在专门测试记忆依赖能力的 RMBench(双臂、需要记住早期状态的基准):无记忆的 BridgeVLA 只能拿到 18.9%,加上记忆模块的 BridgeVLA++ 跳到 96.0%;单臂的 MemoryBench 上更是达到 99.7%。真机测试用 Franka Research 3 和 Dobot CR5A 两款机械臂,每个任务只用 10 条示教演示就完成验证。这个数据分布本身就是最有说服力的论证:记忆模块几乎不影响常规任务的表现,但在真正需要记忆的任务上带来了接近五倍的提升,说明这个补丁精准地打在了问题的根子上,不是靠整体堆参数换来的普遍性提升。
务实之外,这篇论文也有需要如实说的代价。推理速度从每步 0.35 秒降到 0.57 秒(RTX 4090 上测得),对需要快速反应的实时控制场景不是免费的午餐;缓存关键帧的槽位数量需要按具体基准手动调优(RMBench 上设为 12,其他场景设为 2),这意味着把这个记忆模块直接「插拔」到全新任务上未必是零成本的,调参本身仍需要经验。真机验证虽然用了两款真实机械臂,但场景是为了公平对比手动复现的实验室环境,不是开放世界的压力测试——论文里也没有和商业闭源 VLA 模型的直接对比,长时间跨度、面对全新物体时的失效表现也没有详细披露。
但即便有这些局限,我认为这篇论文指出的方向值得关注:把预训练好的 VLM 当作固定底座,只在记忆、动作头、对齐这些外围组件上做文章,这条路线如果继续被验证有效,会实质性降低小团队参与机器人操作研究的门槛——不需要重新训练一个基座模型,只需要在别人训好的底座上做精准的外科手术式改进。这和过去两年机器人研究普遍依赖「把基座做得更大」的主流路线是相反的方向,值得继续观察是否能推广到记忆模块之外的其他能力缺陷上。