中文

面向自动驾驶的多时间尺度层次化强化学习

机器人学 2025-11-25 v3 人工智能

摘要

强化学习 (RL) 正在自动驾驶领域中日益受到重视,显示出明显的优势。然而,大多数基于 RL 的自动驾驶方法忽略了策略结构设计。仅输出短时间尺度车辆控制指令的 RL 策略会因网络输出的波动导致驾驶行为不稳定;而仅输出长时间尺度驾驶目标的策略则无法实现驾驶行为与控制的统一最优性。因此,我们提出了一种多时间尺度层次化强化学习方法。该方法采用层次化策略结构,其中高层和低层 RL 策略联合训练,分别产生长时间尺度的运动指导和短时间尺度的控制指令。其中,运动指导通过混合动作显式表示,以捕捉结构化道路上的多模态驾驶行为,支持增量式的低层扩展状态更新。此外,设计了层次化安全机制以确保多时间尺度的安全性。在仿真环境和 HighD 数据集的高速多车道场景中评估表明,我们的方法显著提高了自动驾驶性能,有效提升了驾驶效率、行驶一致性和安全性。

关键词

引用

@article{arxiv.2506.23771,
  title  = {Multi-Timescale Hierarchical Reinforcement Learning for Unified Behavior and Control of Autonomous Driving},
  author = {Guizhe Jin and Zhuoren Li and Bo Leng and Ran Yu and Lu Xiong and Chen Sun},
  journal= {arXiv preprint arXiv:2506.23771},
  year   = {2025}
}

备注

8 pages, accepted for publication in IEEE Robotics and Automation Letters (RAL)