强化模仿轨迹规划用于城市自动驾驶
机器人学
2025-07-17 v2 人工智能
摘要
强化学习 (RL) 在城市自动驾驶轨迹规划中面临收敛性差以及奖励函数设计困难的挑战。因此,很少有基于 RL 的轨迹规划方法能实现与模仿学习方法相当的性能。通过将 RL 与监督学习结合可缓解收敛问题。然而,大多数现有方法仅考虑一步前瞻,缺乏多步规划能力。此外,虽然逆向强化学习在解决奖励函数设计问题方面具有潜力,但现有的自动驾驶方法对奖励函数施加线性结构假设,难以应用于城市自动驾驶。鉴于上述挑战,本文提出了一种集成 RL 与模仿学习以实现多步规划的新型 RL 轨迹规划方法。进一步developed a 基于 transformer 的贝叶斯奖励函数,为城市场景中的 RL 提供有效奖励信号。此外,提出了一种混合驱动的轨迹规划框架以提升安全性和可解释性。所提方法在大规模真实城市自动驾驶 nuPlan 数据集上进行了验证。采用闭环指标评估,结果表明,所提方法显著优于采用相同策略模型结构的基线方法,并与最新方法性能持平。代码已公开于 https://github.com/Zigned/nuplan_zigned。
引用
@article{arxiv.2410.15607,
title = {Reinforced Imitative Trajectory Planning for Urban Automated Driving},
author = {Di Zeng and Ling Zheng and Xiantong Yang and Yinong Li},
journal= {arXiv preprint arXiv:2410.15607},
year = {2025}
}
备注
21 pages, 9 figures