中文

对抗模仿学习中的奖励函数形状探索:一项实证研究

机器学习 2021-04-15 v1 人工智能

摘要

对于对抗模仿学习算法(AILs),环境并未提供真实的奖励用于学习策略。然而,仍需要基于判别器的输出构造伪奖励。鉴于 AILs 中存在的隐式奖励偏差问题,我们设计了若干具有代表性的奖励函数形状,并通过大规模实验比较了它们的性能。为确保结果的可靠性,我们基于四种不同的 AILs,在一系列 Mujoco 与 Box2D 连续控制任务上开展实验。此外,我们还使用不同数量的专家轨迹比较了各种奖励函数形状的性能。实证结果表明,正对数奖励函数在典型连续控制任务中表现良好;相比之下,所谓无偏奖励函数仅局限于特定类型的任务。此外,若干所设计的奖励函数在这些环境中同样表现优异。

关键词

引用

@article{arxiv.2104.06687,
  title  = {Reward function shape exploration in adversarial imitation learning: an empirical study},
  author = {Yawei Wang and Xiu Li},
  journal= {arXiv preprint arXiv:2104.06687},
  year   = {2021}
}

备注

Accepted by ICAICA2021, the code will be available soon