看见即行动,提示即指定:视觉-语言-动作策略的贝叶斯分解
机器人学
2025-12-15 v1 计算机视觉与模式识别
摘要
视觉-语言-动作(VLA)模型在分布外泛化的追求中,往往因微调期间视觉-语言模型(VLM)骨干网络的灾难性遗忘而受阻。虽然与外部推理数据的联合训练有所帮助,但这需要经验调优和数据相关开销。除此类外部依赖外,我们识别出 VLA 数据集中的内在原因:模态不平衡,即语言多样性远低于视觉和动作多样性。这种不平衡使模型偏向视觉捷径和语言遗忘。为解决此问题,我们引入 BayesVLA,一种贝叶斯分解,将策略分解为支持"看见即行动"的视觉-动作先验和实现"提示即指定"的语言条件似然。这天然保持了泛化能力并促进了指令遵循。我们进一步引入接触前和接触后阶段以更好地利用预训练基础模型。信息论分析从形式上验证了我们在缓解捷径学习方面的有效性。大量实验表明,与现有方法相比,该方法在未见指令、物体和环境上具有优越的泛化能力。项目页面:https://xukechun.github.io/papers/BayesVLA。
引用
@article{arxiv.2512.11218,
title = {Seeing to Act, Prompting to Specify: A Bayesian Factorization of Vision Language Action Policy},
author = {Kechun Xu and Zhenjie Zhu and Anzhe Chen and Shuqi Zhao and Qing Huang and Yifei Yang and Haojian Lu and Rong Xiong and Masayoshi Tomizuka and Yue Wang},
journal= {arXiv preprint arXiv:2512.11218},
year = {2025}
}