面向异构化学术的自我对弈:用于真实高速公路交通仿真
人工智能
2026-04-21 v1 机器学习
多智能体系统
机器人学
摘要
真实的高速公路仿真对于自动驾驶车辆的可扩展安全评估至关重要,尤其是对于难以从日志数据中单独研究的稀有交互互动。然而,高速公路交通生成仍然具有挑战性,因为它需要跨速度和机动动作的广泛覆盖、可控地生成稀有安全关键情景,以及在多智能体互动中实现行为可信度。我们提出PHASE(Policy for Heterogeneous Agent Self-play on Expressway,即面向异构智能体自我对弈的政策),通过显式的per-agent条件化实现可控性、合成情景生成实现广泛的高速公路覆盖、以及闭环多智能体训练实现真实的互动动力学。PHASE进一步支持通过车辆感知和情境条件化动作在单个政策中包含不同的车辆轮廓,例如乘客车和半挂卡车。通过对不可恢复状态的提前终止、责任车祸归属、面向高速公路的奖励塑形、耦合课程和稳健的政策优化,PHASE进一步稳定了自我对弈。尽管仅凭合成数据进行训练,PHASE仍能零样本地在exiD中512个未知的高互动真实情景中实现96.3%的成功率,并将ADE/FDE从6.57/12.07米降低到2.44/5.25米,相对于以前的自我对弈基线。 在学习的轨迹嵌入空间中,它还通过减少Frechet轨迹距离13.1%和能量距离20.2%,在行为真实性方面优于IDM。这些结果表明,合成自我对弈可以为可控且真实的高速公路情景生成提供可扩展的路径,而无需直接模仿专家日志。
引用
@article{arxiv.2604.16406,
title = {Heterogeneous Self-Play for Realistic Highway Traffic Simulation},
author = {Jinkai Qiu and Alessandro Saviolo and Chaojie Wang and Mingke Wang and Xiaoyu Huang},
journal= {arXiv preprint arXiv:2604.16406},
year = {2026}
}
备注
8 pages, 2026 CVPR SAD Workshop