动作即语言:将 VLM 微调为 VLA 且避免灾难性遗忘
机器人学
2025-09-29 v1
摘要
在机器人遥操作数据上微调视觉语言模型(VLM)以创建视觉语言动作(VLA)模型是训练通用策略的有前景范式,但它面临一个基本权衡:学习生成动作通常会削弱 VLM 的基础推理与多模态理解能力,阻碍其对新颖场景的泛化、指令遵循与语义理解。我们认为这种灾难性遗忘源于 VLM 的互联网规模预训练语料库与机器人微调数据之间的分布失配。受此观察启发,我们引入了 VLM2VLA:一种 VLA 训练范式,首先通过用自然语言表示低层动作在数据层面解决该失配。这种对齐使得仅用低秩适应(LoRA)训练 VLA 成为可能,从而最小程度地修改 VLM 主干并避免灾难性遗忘。因此,VLM 可以在机器人遥操作数据上进行微调,而无需从根本上改变底层架构,也无需在互联网规模 VLM 数据集上进行昂贵的协同训练。通过广泛的视觉问答(VQA)研究与超过 800 次的真实世界机器人实验,我们证明 VLM2VLA 保留了 VLM 的核心能力,实现了对需要开放世界语义推理与多语言指令遵循的新颖任务的零样本泛化。
引用
@article{arxiv.2509.22195,
title = {Actions as Language: Fine-Tuning VLMs into VLAs Without Catastrophic Forgetting},
author = {Asher J. Hancock and Xindi Wu and Lihan Zha and Olga Russakovsky and Anirudha Majumdar},
journal= {arXiv preprint arXiv:2509.22195},
year = {2025}
}