关于基于专家示范的 KL 正则化强化学习中的病态训练动态
机器学习
2022-12-29 v1 人工智能
统计方法学
机器学习
摘要
基于专家示范的 KL 正则化强化学习已被证明能够提高深度强化学习算法的样本效率,使其可应用于具有挑战性的真实物理世界任务。然而,我们表明,使用从专家示范导出的行为参考策略的 KL 正则化强化学习,可能会遭受病态的训练动态,从而导致缓慢、不稳定且次优的在线学习。我们通过实验证明,该病态现象在常用选择的行为策略类中会出现,并展示了其对样本效率和在线策略性能的影响。最后,我们表明该病态可通过非参数行为参考策略来补救,并且这使得 KL 正则化强化学习在各种具有挑战性的运动控制和灵巧手操作任务上显著优于最先进的方法。
引用
@article{arxiv.2212.13936,
title = {On Pathologies in KL-Regularized Reinforcement Learning from Expert Demonstrations},
author = {Tim G. J. Rudner and Cong Lu and Michael A. Osborne and Yarin Gal and Yee Whye Teh},
journal= {arXiv preprint arXiv:2212.13936},
year = {2022}
}
备注
Published in Advances in Neural Information Processing Systems 34 (NeurIPS 2021)