基于广义下界 Q 学习的自我模仿学习
机器学习
2021-02-16 v3 机器学习
摘要
由下界 Q 学习驱动的自我模仿学习是一种新颖且有效的离策略学习方法。本文中,我们提出一个 n 步下界,它推广了原始的基于回报的下界 Q 学习,并引入了一族新的自我模仿学习算法。为了对自我模仿学习带来的潜在性能增益提供形式化的动机,我们证明 n 步下界 Q 学习在不动点偏差与收缩率之间实现了权衡,并与流行的未校正 n 步 Q 学习建立了紧密联系。最后,我们在一系列连续控制基准任务上证明,n 步下界 Q 学习是比基于回报的自我模仿学习和未校正 n 步方法更稳健的替代方案。
引用
@article{arxiv.2006.07442,
title = {Self-Imitation Learning via Generalized Lower Bound Q-learning},
author = {Yunhao Tang},
journal= {arXiv preprint arXiv:2006.07442},
year = {2021}
}
备注
Accepted at NeurIPS (Neural Information Processing Systems) 2020, Vancouver, Canada. Code is available at https://github.com/robintyh1/nstep-sil