MergeVLA:跨技能模型合并面向通用视觉-语言-动作智能体
机器人学
2026-03-12 v2
摘要
最近的视觉-语言-动作(VLA)模型通过调优数以万计的机器人演示来重新表述视觉-语言模型。虽然它们在针对单个本体或任务家族进行微调时表现良好,但在扩展到多技能场景时仍面临挑战:直接合并在不同任务上训练的VLA专家会导致接近零的成功率。这引出一个根本性问题:什么阻碍了VLA掌握单个模型中的多个技能?通过对VLA微调期间可学习参数的经验分解,我们识别出两个导致不可合并性的关键来源:(i) 微调会导致VLM背板中的LoRA适配器趋向于任务特定的方向,超出现有合并方法的统一能力;(ii) 动作专家通过自注意力反馈发展出块间依赖,导致任务信息在层间扩散,阻止模块化重组合。为此,我们提出MergeVLA,一种通过设计保留可合并性的VLA架构。MergeVLA通过任务掩码引入稀疏激活的LoRA适配器,以保持一致的参数并减少不可调和的冲突。其动作专家用交叉注意力块取代自注意力,以保持专业化的局部性和可组合性。当任务未知时,它使用基于测试的任务路由器,从初始观察中自适应选择合适的任务掩码和专家头,实现无监督任务推断。在LIBERO、LIBERO-Plus、RoboTwin以及真实SO101机械臂上的多任务实验中,MergeVLA实现了与或甚至超过单个微调专家相当的性能,展示了在任务、本体和环境方面的稳健泛化。项目页面:https://mergevla.github.io/。
引用
@article{arxiv.2511.18810,
title = {MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent},
author = {Yuxia Fu and Zhizhen Zhang and Yuqi Zhang and Zijian Wang and Zi Huang and Yadan Luo},
journal= {arXiv preprint arXiv:2511.18810},
year = {2026}
}
备注
Accepted to CVPR 2026