中文

自动驾驶中的奖励(误)设计

机器学习 2022-03-15 v2

摘要

本文考虑诊断奖励设计中某些常见错误的问题。其见解也普遍适用于成本函数和性能度量更广泛意义上的设计。为诊断常见错误,我们开发了 8 个简单的合理性检验用于识别奖励函数中的缺陷。这些合理性检验被应用于以往自动驾驶(AD)强化学习(RL)工作的奖励函数,揭示了 AD 奖励设计中近乎普遍的缺陷,这些缺陷也可能普遍存在于其他任务的奖励设计中。最后,我们探索了在后续研究中可能有助于 AD 奖励函数设计的有前景方向,遵循一个可适配其他领域的探究过程。

关键词

引用

@article{arxiv.2104.13906,
  title  = {Reward (Mis)design for Autonomous Driving},
  author = {W. Bradley Knox and Alessandro Allievi and Holger Banzhaf and Felix Schmitt and Peter Stone},
  journal= {arXiv preprint arXiv:2104.13906},
  year   = {2022}
}

备注

14 pages (27 pages with appendix), 4 figures