VLA模型的双角色微调:一种谈改人类在回环方法
机器人学
2025-09-18 v1
摘要
视觉语言动作(VLA)模型在机器人操作中显示出强大的泛化能力,但在复杂真实任务中面临挑战。虽然基于演示的监督微调受限于数据质量,但强化学习(RL)提供了有前景的替代方案。我们提出一种基于 RL 的人类在回环双角色微调框架。该框架集成了用于稳健多任务性能的主角色,以及用于潜在空间调整的细化角色。除标准物理干预外,我们引入一种轻量级谈改方案,将人类纠正转换为语义导向的语言命令,从而生成用于策略学习的新数据集。在真实世界的多任务实验中,我们的方法在 101 分钟的在线微调内实现了三个任务的 100% 成功率。对于长期任务,它在 12 项连续操作中保持 50% 的成功率。此外,该框架在多机器人训练中效果显著,在使用双机器人时实现了最高可达 2 倍的效率提升。实验视频已公开:https://sites.google.com/view/hil-daft/
引用
@article{arxiv.2509.13774,
title = {Dual-Actor Fine-Tuning of VLA Models: A Talk-and-Tweak Human-in-the-Loop Approach},
author = {Piaopiao Jin and Qi Wang and Guokang Sun and Ziwen Cai and Pinjia He and Yangwei You},
journal= {arXiv preprint arXiv:2509.13774},
year = {2025}
}