中文

生成对抗自模仿学习

机器学习 2018-12-04 v1 人工智能 机器学习

摘要

本文通过提出生成对抗自模仿学习 (GASIL) 探索了一种用于强化学习的简单正则化器,其鼓励智能体通过生成对抗模仿学习框架来模仿过去的好轨迹。GASIL 不直接最大化奖励,而是专注于复现过去的好轨迹,当奖励稀疏且延迟时,这有可能使长期信用分配更容易。GASIL 可通过将 GASIL 用作学习到的塑形奖励函数,轻松地与任何策略梯度目标结合。我们的实验结果表明,在具有延迟奖励和随机动力学的 2D Point Mass 与 MuJoCo 环境中,GASIL 提升了近端策略优化的性能。

关键词

引用

@article{arxiv.1812.00950,
  title  = {Generative Adversarial Self-Imitation Learning},
  author = {Yijie Guo and Junhyuk Oh and Satinder Singh and Honglak Lee},
  journal= {arXiv preprint arXiv:1812.00950},
  year   = {2018}
}