基于双层多臂老虎机的分层强化学习用于无信号交叉口交互感知自动驾驶
机器人学
2025-02-07 v1
摘要
在这项工作中,我们提出了 BiM-ACPPO,一个基于双层多臂老虎机的分层强化学习框架,用于无信号交叉口的交互感知决策与规划。本质上,它主动考虑了与周围车辆(SVs)相关的不确定性,这些不确定性包括源自驾驶员意图、交互行为以及周围车辆数量变化的不确定性。引入中间决策变量,使高层强化学习策略能够提供交互感知参考,用于指导底层模型预测控制(MPC),并进一步增强所提框架的泛化能力。通过利用无信号交叉口自动驾驶的结构化特性,将强化学习策略的训练问题建模为双层课程学习任务,并由所提出的基于 Exp3.S 的 BiMAB 算法解决。值得注意的是,训练课程是动态调整的,从而提高了强化学习训练过程的样本效率。在高保真 CARLA 模拟器中进行了对比实验,结果表明,与所有基线方法相比,我们的方法取得了更优的性能。此外,在两个新的城市驾驶场景中的实验结果清楚地证明了所提方法具有值得称赞的泛化性能。
引用
@article{arxiv.2502.03960,
title = {Bilevel Multi-Armed Bandit-Based Hierarchical Reinforcement Learning for Interaction-Aware Self-Driving at Unsignalized Intersections},
author = {Zengqi Peng and Yubin Wang and Lei Zheng and Jun Ma},
journal= {arXiv preprint arXiv:2502.03960},
year = {2025}
}
备注
This paper has been accepted by IEEE Transactions on Vehicular Technology