中文

自编码对抗模仿学习

机器学习 2024-02-05 v5

摘要

强化学习(RL)为决策提供了一个强有力的框架,但其在实际中的应用通常需要精心设计的奖励函数。对抗模仿学习(AIL)为无需环境奖励信号即可自动获取策略提供了思路。本文提出自编码对抗模仿学习(AEAIL),一个鲁棒且可扩展的 AIL 框架。为从示范中推导专家策略,AEAIL 利用自编码器的重构误差作为奖励信号,相较于先前基于判别器的方法,其为策略优化提供了更多信息。随后,我们使用导出的目标函数训练自编码器和智能体策略。实验表明,我们的 AEAIL 在基于状态和基于图像的环境中均优于最先进的方法。更重要的是,当专家示范含有噪声时,AEAIL 表现出好得多的鲁棒性。

关键词

引用

@article{arxiv.2206.11004,
  title  = {Auto-Encoding Adversarial Imitation Learning},
  author = {Kaifeng Zhang and Rui Zhao and Ziming Zhang and Yang Gao},
  journal= {arXiv preprint arXiv:2206.11004},
  year   = {2024}
}

备注

13 pages