中文

如何从风险中学习:面向高效安全驾驶策略的显式风险-效用强化学习

机器学习 2022-08-03 v2

摘要

自动驾驶有潜力变革出行方式,因此是一个活跃的研究领域。在实践中,自动驾驶车辆的行为必须可接受,即高效、安全且可解释。虽然原始强化学习(RL)能找到高性能的行为策略,但它们通常不安全且不可解释。安全通过Safe RL方法引入,但它们大多仍不可解释,因为所学行为是为安全性和性能联合优化而未分别建模。可解释机器学习很少应用于RL。本文提出SafeDQN,其能使自动驾驶车辆的行为安全且可解释,同时保持高效。SafeDQN在动作的预期风险与效用之间提供可理解的语义权衡,同时具有算法透明性。我们展示了SafeDQN为多种场景找到可解释且安全的驾驶策略,并演示了最先进的显著性技术如何帮助评估风险和效用。

关键词

引用

@article{arxiv.2203.08409,
  title  = {How to Learn from Risk: Explicit Risk-Utility Reinforcement Learning for Efficient and Safe Driving Strategies},
  author = {Lukas M. Schmidt and Sebastian Rietsch and Axel Plinge and Bjoern M. Eskofier and Christopher Mutschler},
  journal= {arXiv preprint arXiv:2203.08409},
  year   = {2022}
}

备注

8 pages, 5 figures