中文

残差离策略强化学习用于行为克隆策略的微调

机器人学 2025-09-29 v2 机器学习

摘要

行为克隆(BC)的最新进展已实现惊人的视觉运动控制策略。然而,这些方法受限于人类演示的质量、数据收集的手动工作量,以及离线数据收益的递减。与此相比,强化学习(RL)通过与环境的自主交互来训练智能体,在各个领域已展现卓越成就。尽管如此,直接在真实机器人上训练 RL 策略仍然具有挑战性,主要因素包括样本效率不足、安全问题,以及在高自由度(DoF)系统上学习稀疏奖励的长期任务仍具困难。我们提出一种将 BC 与 RL 优势结合的配方,通过残差学习框架实现。我们的做法将 BC 策略作为黑盒基座,并通过样本高效的离策略 RL 学习轻量级的逐步残差修正。我们演示,该方法仅需稀疏二元奖励信号,即可有效改进高自由度(DoF)系统上的操作策略,无论是仿真还是真实世界。特别是,我们据此证明,已知最佳实践中,首次在具备灵巧手臂的人形机器人上实现了成功的真实世界 RL 训练。我们的结果在各种基于视觉的任务中实现了最先进的性能,指向在实际中部署 RL 的可行路径。

关键词

引用

@article{arxiv.2509.19301,
  title  = {Residual Off-Policy RL for Finetuning Behavior Cloning Policies},
  author = {Lars Ankile and Zhenyu Jiang and Rocky Duan and Guanya Shi and Pieter Abbeel and Anusha Nagabandi},
  journal= {arXiv preprint arXiv:2509.19301},
  year   = {2025}
}

备注

Project website: https://residual-offpolicy-rl.github.io