中文

ConRFT:基于一致性策略的VLA模型强化微调方法

机器人学 2025-04-15 v2 人工智能

摘要

视觉语言-动作(VLA)模型在实际机器人操作中展现出巨大的潜力。然而,由于受限于演示数据稀少且不一致,尤其是在接触丰富的环境中,基于监督学习的微调方法难以实现稳健的性能。本文提出一种用于VLA模型的强化微调方法,称为ConRFT,包括离线和在线微调,采用统一的基于一致性的训练目标以应对上述挑战。在离线阶段,我们的方法整合行为克隆和Q学习,以有效从小规模演示数据中提取策略并稳定价值估计。在线阶段,通过一致性策略进一步微调VLA模型,结合人类干预以确保安全探索和高样本效率。我们在八个多样化的真实世界操作任务上评估了该方法。在45-90分钟的在线微调后,实现了96.3%的平均成功率,凭借统一的方法,相较于以前的监督方法,在成功率上提升了144%,而剂量长度缩短了1.9倍。这一工作凸显了将强化学习集成到提升VLA模型在真实世界机器人应用中性能方面的潜力。视频和代码已在我们的项目网站https://cccedric.github.io/conrft/上提供。

关键词

引用

@article{arxiv.2502.05450,
  title  = {ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy},
  author = {Yuhui Chen and Shuai Tian and Shugao Liu and Yingting Zhou and Haoran Li and Dongbin Zhao},
  journal= {arXiv preprint arXiv:2502.05450},
  year   = {2025}
}