中文

简单配方即可:视觉语言-动作模型是通过强化学习获得的自然持续学习者

机器学习 2026-03-13 v1 机器人学

摘要

面向自我改进的具身智能体在开放式、不断演化的环境中实现自适应的持续强化学习(CRL)是一条值得期待的道路。然而,来自持续学习的常规观念表明,朴素的顺序微调(Seq. FT)会导致灾难性遗忘,从而需要复杂的 CRL 策略。本文我们退一步,系统地研究了大规模预训练视觉语言-动作模型(VLA)的持续强化学习。在三个模型和五个具有挑战性的终身 RL 基准测试上进行研究。我们发现,与既定信念相反,简单地使用低秩适应(LoRA)的 Seq. FT 效果令人惊讶地强大:它实现了高塑性,几乎没有遗忘,保持了强大的零样例泛化,经常超过更复杂的 CRL 方法。通过详细分析,我们显示,这种鲁棒性源于大型预训练模型、参数高效适应和基于策略的 RL 之间的协同作用。正是这些组件重新塑造了稳定性-塑性权衡,使得持续适应既稳定又可扩展。我们的结果将顺序微调定位为 VLAs 持续 RL 的强大方法,并为大模型时代的终身学习提供新的见解。代码已在 github.com/UT-Austin-RobIn/continual-vla-rl 上提供。

关键词

引用

@article{arxiv.2603.11653,
  title  = {Simple Recipe Works: Vision-Language-Action Models are Natural Continual Learners with Reinforcement Learning},
  author = {Jiaheng Hu and Jay Shim and Chen Tang and Yoonchang Sung and Bo Liu and Peter Stone and Roberto Martin-Martin},
  journal= {arXiv preprint arXiv:2603.11653},
  year   = {2026}
}