中文

面向长寿机器人的路径:基于强化微调的持续学习 VLA 模型

机器人学 2026-05-19 v2

摘要

大规模且多样化的数据预训练后,VLA 模型在作为通用机器人策略方面表现出强大的泛化能力和适应性。然而,作为适配 VLA 模型到下游领域的主要机制,监督式微调 (SFT) 需要大量任务特定数据,并且容易发生灾难性遗忘。为此,我们提出了一种独立于在线环境反馈和预训练奖励模型的简单而有效的强化微调 (RFT) 策略——LifeLong-RFT。通过将分块级在策略强化学习集成,我们提出了多维过程奖励机制,以量化中间动作块在三个维度上的异构贡献,以促进策略优化。具体而言:(1) 量化动作一致性奖励 (QACR) 确保离散动作空间内的准确动作预测;(2) 持续轨迹对齐奖励 (CTAR) 将解码的连续动作块与参考轨迹对齐,以确保精确控制;(3) 格式合规奖励 (FCR) 保证输出的结构有效性。跨 SimplerEnv、LIBERO 和真实世界任务的全面实验表明,LifeLong-RFT 在多任务学习中表现出色。此外,在 LIBERO 基准上进行持续学习时,我们的方法在平均成功率上比 SFT 提升了 22%,同时仅使用 20% 的训练数据即可有效适应新任务。总体而言,我们的方法为 VLA 的后训练范式提供了有前景的方案。项目页面可在 <https://yuan-liu-lifelong-rft.github.io> 查看。

关键词

引用

@article{arxiv.2602.10503,
  title  = {Towards Long-Lived Robots: Continual Learning VLA Models via Reinforcement Fine-Tuning},
  author = {Yuan Liu and Haoran Li and Shuai Tian and Yuxing Qin and Yuhui Chen and Yupeng Zheng and Yongzhen Huang and Dongbin Zhao},
  journal= {arXiv preprint arXiv:2602.10503},
  year   = {2026}
}