中文

基于不确定性估计加速残差强化学习

机器学习 2026-03-16 v2 人工智能 机器人学

摘要

残差强化学习 (Residual RL) 是一种流行的用于通过学习轻量级残差策略来适应预训练策略的方法,这些残差策略提供纠正动作。虽然残差 RL 比对整个基础策略进行微调更具样本效率,但现有方法在稀疏奖励方面仍存在挑战,且设计时针对的是确定性基础策略。我们提出了两种改进,进一步增强了残差 RL 的样本效率,并使其适用于随机基础策略。首先,我们利用基础策略的不确定性估计,聚焦于基础策略置信度不高的区域进行探索。其次,我们提出了一种简单的修改,用于离-policy 残差学习,使其能够观察基础动作,从而更好地处理随机基础策略。我们使用基于高斯的和基于扩散的随机基础策略,在来自 Robosuite 和 D4RL 的任务上进行评估,并与最先进的微调方法、演示增强型 RL 方法以及其他残差 RL 方法进行比较。我们的算法在各种模拟基准环境中显著优于现有基线方法。我们还在实际世界中部署所学策略,以零样 sim-to-real 迁移展示其鲁棒性。论文主页: lakshitadodeja.github.io/uncertainty-aware-residual-rl/

关键词

引用

@article{arxiv.2506.17564,
  title  = {Accelerating Residual Reinforcement Learning with Uncertainty Estimation},
  author = {Lakshita Dodeja and Karl Schmeckpeper and Shivam Vats and Thomas Weng and Mingxi Jia and George Konidaris and Stefanie Tellex},
  journal= {arXiv preprint arXiv:2506.17564},
  year   = {2026}
}