面向稀疏奖励目标条件强化学习的相位式自我模仿约简
机器学习
2022-06-27 v1 人工智能
摘要
近期一种趋势是利用监督学习(SL)的力量来构建更有效的强化学习(RL)方法。我们提出了一种新颖的相位式方法,通过交替进行在线RL与离线SL来解决稀疏奖励目标条件问题。在在线阶段,我们执行RL训练并收集滚动数据;而在离线阶段,我们对数据集中那些成功的轨迹执行SL。为了进一步提高样本效率,我们在在线阶段采用了额外技术,包括用于生成更多可行轨迹的任务约简,以及基于价值差的内在奖励以缓解稀疏奖励问题。我们将这一整体算法称为相位式自我模仿约简(PAIR)。在稀疏奖励目标条件的机器人控制问题(包括一项具有挑战性的堆叠任务)上,PAIR大幅优于非相位式RL与相位式SL基线。PAIR是首个仅从零开始利用0/1成功奖励学会堆叠6个立方体的RL方法。
引用
@article{arxiv.2206.12030,
title = {Phasic Self-Imitative Reduction for Sparse-Reward Goal-Conditioned Reinforcement Learning},
author = {Yunfei Li and Tian Gao and Jiaqi Yang and Huazhe Xu and Yi Wu},
journal= {arXiv preprint arXiv:2206.12030},
year = {2022}
}
备注
Accepted at ICML 2022