面向行人行为不确定性的基于多智能体强化学习的安全自主驾驶
机器学习
2026-05-27 v2 人工智能
人机交互
机器人学
摘要
仿真测试自主驾驶汽车 (SDC) 通常依赖脚本化行人模型,这些模型未能捕捉真实横穿行为的异质性和不确定性,限制了安全评估的真实性,尤其是对于 jaywalking 行为,因为这种行为受潜在人格特征支配,而车辆无法观察。我们假设,通过多智能体强化学习 (MARL) 联合训练行人和 SDC 可产生比固定行人策略更真实的交互场景,并且从轨迹中可直接测量可预测与不可预测横穿之间的行为差距。我们使用 Multi-Agent Proximal Policy Optimization (MAPPO) 对 SDC 和 12 个行人进行联合训练:行人运动遵循脚本化 Dijkstra 最短路径,而 RL 策略控制高层的通过/等待决策,jaywalking 概率取决于每位行人的特征,在剧集开始时抽样且对 SDC 隐私。在 500 集回合评估中,联合训练的 SDC 在 78% 的目标达成率下以 14% 的碰撞率运行,而最佳基于规则的基线为 35%/33%。速度差异指标显示,SDC 在靠近 jaywalker 时比靠近斑马线用户行驶速度快 2.65 米/秒,表明 jaywalking 事件未被预期。jaywalking 占横穿事件的 13%,但占碰撞事件的 62%,联合训练将碰撞率降低了 30%,因为行人学会在 SDC 以速度接近时等待。
引用
@article{arxiv.2605.20255,
title = {Multi-Agent Reinforcement Learning for Safe Autonomous Driving Under Pedestrian Behavioral Uncertainty},
author = {Prakash Aryan and Kaushik Raghupathruni and Timo Kehrer and Sebastiano Panichella},
journal= {arXiv preprint arXiv:2605.20255},
year = {2026}
}
备注
Accepted to ICRA 2026 Workshop "8th Workshop on Long-term Human Motion Prediction"