中文

学习自模仿的多样化策略

机器学习 2019-02-26 v2 机器学习

摘要

深度强化学习中流行算法(如策略梯度和 Q-learning)的成功,严重依赖于序贯决策过程中每个时间步均有信息丰富的奖励信号。当奖励仅在一个回合中稀疏可得,或仅在回合终止后提供奖励反馈时,由于信用分配困难,这些算法表现次优。另一方面,基于轨迹的策略优化方法(如交叉熵方法和进化策略)不需要逐时间步奖励,但已被发现因完全忽略问题的时间特性而具有高样本复杂度。因此,提升 RL 算法在具有稀疏或回合式奖励的现实问题中的效率是一项迫切需求。本工作中,我们引入一种在稀疏与回合式奖励设定下既能利用又能探索的自模仿学习算法。我们将每个策略视为状态-动作访问分布,并将策略优化表述为散度最小化问题。我们证明,使用 Jensen-Shannon 散度时,该散度最小化问题可化简为一种从经验回放中学习塑形奖励的策略梯度算法。实验结果表明,我们的算法在稠密奖励环境中与现有算法表现相当,而在稀疏与回合式奖励环境中显著更优。随后我们讨论自模仿学习的局限性,并提出通过使用带有 Jensen-Shannon 核的 Stein 变分策略梯度下降来学习多个多样化策略加以解决。我们在连续的 MuJoCo 运动控制任务的挑战性变体上展示了其有效性。

关键词

引用

@article{arxiv.1805.10309,
  title  = {Learning Self-Imitating Diverse Policies},
  author = {Tanmay Gangwani and Qiang Liu and Jian Peng},
  journal= {arXiv preprint arXiv:1805.10309},
  year   = {2019}
}

备注

ICLR 2019