利用鸟瞰状态表示高效学习城市驾驶策略
机器人学
2023-08-16 v2
摘要
自动驾驶在高度交互的环境中涉及复杂决策,需要与其他交通参与者进行审慎协商。虽然强化学习提供了一种学习此类交互行为的方式,但高效学习关键依赖于可扩展的状态表示。与模仿学习方法相反,高维状态表示仍是自动驾驶中深度强化学习方法的主要瓶颈。本文中,我们研究构建自动驾驶鸟瞰表示的挑战,并提出一种用于长时域驾驶的循环学习架构。我们基于 PPO 的方法称为 RecurrDriveNet,在 CARLA 中的模拟自动驾驶任务上得到验证,其优于传统的帧堆叠方法,同时仅需一百万次经验即可高效训练。RecurrDriveNet 在与其它道路使用者安全交互的情况下,每行驶公里犯规少于一次。
引用
@article{arxiv.2305.19904,
title = {Efficient Learning of Urban Driving Policies Using Bird's-Eye-View State Representations},
author = {Raphael Trumpp and Martin Büchner and Abhinav Valada and Marco Caccamo},
journal= {arXiv preprint arXiv:2305.19904},
year = {2023}
}
备注
IEEE International Conference on Intelligent Transportation Systems 2023