当生活给出BC,就制作Q函数:从行为克隆中提取Q值用于机器人强化学习
机器人学
2026-05-07 v1 人工智能
摘要
行为克隆(BC)已成为机器人学习中高度有效的范式。然而,BC缺乏 demonstrations 收集后用于在线改进的自导机制。现有的离线到在线学习方法常因离线数据与在线学习之间的分布不匹配,导致策略取代先前学习的良好动作。在本工作中,我们提出Q2RL,Q-估计和Q-门控,从BC到RL的高效离线到在线学习算法。我们的方法包含两个部分:(1)Q-估计通过与环境少量交互步骤从BC策略中提取Q函数,随后进行在线RL;(2)Q-门控根据各自Q值在BC和RL策略动作之间切换,以收集RL策略训练的样本。我们在D4RL和robomimic基准中的操作任务中,Q2RL在成功率和收敛时间上均优于最先进的离线到在线学习基线。Q2RL足够高效,可应用于on-robot RL设置,在学习管道装配和kitting等接触丰富且高精度操作任务时,只需1-2小时的在线交互,即可实现最高100%的成功率,并相对于原始BC策略实现最高3.75倍的改进。代码和视频可在https://pages.rai-inst.com/q2rl_website/获取。
引用
@article{arxiv.2605.05172,
title = {When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning},
author = {Lakshita Dodeja and Ondrej Biza and Shivam Vats and Stephen Hart and Stefanie Tellex and Robin Walters and Karl Schmeckpeper and Thomas Weng},
journal= {arXiv preprint arXiv:2605.05172},
year = {2026}
}