中文

MAPS: 通过模块级邻近调度保持视觉-语言表示以实现更好的视觉-语言-动作泛化

计算机视觉与模式识别 2025-11-26 v1 人工智能 计算与语言 机器学习 机器人学

摘要

视觉-语言-动作(VLA)模型继承了来自预训练视觉-语言模型(VLM)的强先验,但盲目微调往往会破坏这些表示并损害泛化能力。现有的解决方案——冻结模块或应用统一正则化——要么过度限制适应性,要么忽略 VLA 组件不同角色的差异。我们提出MAPS(Module-Wise Proximity Scheduling),这是一种首创性的VLA微调框架。通过系统性分析,我们发现近似约束的松弛顺序存在经验规律,以平衡稳定性与灵活性。MAPS线性调度这种松弛,使视觉编码器保持接近其预训练先验,同时让面向动作的语言层更自由地适应。MAPS不引入额外参数或数据,可无缝集成到现有 VLA 中。在MiniVLA-VQ、MiniVLA-OFT、OpenVLA-OFT以及SimplierEnv、CALVIN、LIBERO等具有挑战性的基准测试中,以及Franka Emika Panda平台的实际评估中,MAPS consistently提升了分布内和分布外性能(提升最高可达+30%)。我们的发现表明,经验导向的接近预训练 VLM是一种简单而强大的原则,可在VLM到VLA的转移中保留广泛泛化能力。

关键词

引用

@article{arxiv.2511.19878,
  title  = {MAPS: Preserving Vision-Language Representations via Module-Wise Proximity Scheduling for Better Vision-Language-Action Generalization},
  author = {Chengyue Huang and Mellon M. Zhang and Robert Azarcon and Glen Chou and Zsolt Kira},
  journal= {arXiv preprint arXiv:2511.19878},
  year   = {2025}
}