通过策略约束与 Q 集成加速基于演示的自模仿学习
机器学习
2022-12-08 v1
摘要
深度强化学习(DRL)为生成机器人控制策略提供了新途径。然而,控制策略的训练过程需要漫长的探索,导致强化学习(RL)在真实世界任务中样本效率低下。模仿学习(IL)与从演示中学习(LfD)利用专家演示改善训练过程,但不完美的专家演示可能误导策略改进。离线到在线强化学习需要大量离线数据来初始化策略,且分布偏移易在在线微调时导致性能退化。为解决上述问题,我们提出一种从演示中学习的方法 A-SILfD,该方法将专家演示视为智能体的成功经验,并利用这些经验约束策略改进。此外,我们通过集成 Q 函数来防止由于 Q 函数中较大估计误差导致的性能退化。我们的实验表明,A-SILfD 可利用少量不同质量的专家演示显著提升样本效率。在四个 Mujoco 连续控制任务中,A-SILfD 在 150,000 步在线训练后显著优于基线方法,且在训练过程中不被不完美的专家演示所误导。
引用
@article{arxiv.2212.03562,
title = {Accelerating Self-Imitation Learning from Demonstrations via Policy Constraints and Q-Ensemble},
author = {Chao Li},
journal= {arXiv preprint arXiv:2212.03562},
year = {2022}
}