中文

(Re)$^2$H2O:基于反向正则化离线与在线混合强化学习的自动驾驶场景生成

机器学习 2023-06-13 v2 人工智能

摘要

自动驾驶及其广泛应用长久以来都蕴含着巨大前景。然而,若无可靠且全面的测试流程,不仅产业界难以量产自动驾驶汽车(AV),公众与政策制定者也无法被说服接受这些创新。生成对 AV 构成重大挑战的安全关键场景是测试的首要步骤。真实世界数据集包含自然但过于安全的驾驶行为,而仿真可不受限制地探索多样且激进的交通场景。反之,仿真中更高维的搜索空间若无真实数据分布作为隐式约束,则无法实现高效场景生成。为兼顾二者优势,同时从离线真实世界与在线仿真数据学习生成场景显得颇具吸引力。因此,我们定制了一种反向正则化离线与在线混合((Re)2^2H2O)强化学习方案,对真实数据上的 Q 值额外施加惩罚、对仿真数据上的 Q 值给予奖励,从而确保生成场景既多样又具对抗性。大量实验证明,我们的方案比竞争基线产生更危险的场景,且可泛化用于多种自动驾驶模型。此外,这些生成场景也被证实能够微调 AV 性能。

关键词

引用

@article{arxiv.2302.13726,
  title  = {(Re)$^2$H2O: Autonomous Driving Scenario Generation via Reversely Regularized Hybrid Offline-and-Online Reinforcement Learning},
  author = {Haoyi Niu and Kun Ren and Yizhou Xu and Ziyuan Yang and Yichen Lin and Yi Zhang and Jianming Hu},
  journal= {arXiv preprint arXiv:2302.13726},
  year   = {2023}
}

备注

Accepted in IEEE Intelligent Vehicles Symposium 2023