中文

确定性与判别性模仿(D2-Imitation):重新审视对抗模仿的样本效率

机器学习 2022-04-14 v3

摘要

样本效率对于模仿学习方法在真实世界应用中的适用性至关重要。许多研究将对抗模仿扩展为离策略以提高样本效率,却无视这些离策略扩展可能改变原目标或涉及复杂优化。我们重新审视对抗模仿的基础,提出一种无需对抗训练或极小极大优化的离策略样本高效方法。我们的公式基于两个关键洞见:(1)Bellman 方程与平稳状态-动作分布方程间的相似性,使我们能推导一种新颖的时序差分(TD)学习方法;(2)确定性策略的使用简化了 TD 学习。结合二者得到一种实用算法——确定性与判别性模仿(D2-Imitation),其先将样本划分入两个回放缓冲,再通过离策略强化学习学习确定性策略。我们的实验结果表明,D2-Imitation 能有效实现良好样本效率,在许多控制任务上优于多种对抗模仿的离策略扩展方法。

关键词

引用

@article{arxiv.2112.06054,
  title  = {Deterministic and Discriminative Imitation (D2-Imitation): Revisiting Adversarial Imitation for Sample Efficiency},
  author = {Mingfei Sun and Sam Devlin and Katja Hofmann and Shimon Whiteson},
  journal= {arXiv preprint arXiv:2112.06054},
  year   = {2022}
}

备注

AAAI 2022