CO-RFT: 通过分块离线强化学习高效微调视觉-语言-动作模型
机器人学
2025-08-05 v1 机器学习
摘要
视觉-语言-动作(VLA)模型在现实世界机器人控制中展现出开发通用策略的巨大潜力。这一进展激励研究人员探索使用强化学习(RL)微调这些模型。然而,使用RL微调VLA模型仍面临样本效率、与动作分块的兼容性以及训练稳定性方面的挑战。为解决这些挑战,我们探索通过结合动作分块的离线强化学习来微调VLA模型。在这项工作中,我们提出了Chunked RL,一种专门为VLA模型设计的新型强化学习框架。在此框架内,我们将时序差分(TD)学习扩展到包含动作分块,这是VLA模型的一个显著特征。基于此框架,我们提出了CO-RFT算法,旨在使用有限数量的演示(30到60个样本)微调VLA模型。具体来说,我们首先进行全参数微调的模仿学习(IL)来初始化骨干网络和策略。随后,我们实施带有动作分块的离线RL来优化预训练策略。我们在真实世界环境中的实验结果表明,CO-RFT优于先前的监督方法,成功率达到57%的提升,周期时间减少22.3%。此外,我们的方法展现出强大的位置泛化能力,在未见过的位置上达到了44.3%的成功率。
引用
@article{arxiv.2508.02219,
title = {CO-RFT: Efficient Fine-Tuning of Vision-Language-Action Models through Chunked Offline Reinforcement Learning},
author = {Dongchi Huang and Zhirui Fang and Tianle Zhang and Yihang Li and Lin Zhao and Chunhe Xia},
journal= {arXiv preprint arXiv:2508.02219},
year = {2025}
}