中文

TSC: 面向交互式驾驶中多智能体强化学习的拓扑条件化Stackelberg协调

机器人学 2026-03-02 v1

摘要

在密集交通中实现安全高效的自动驾驶本质上是一个去中心化的多智能体协调问题,其中在合流和交织等冲突点的交互必须在部分可观测条件下可靠地解决。仅凭局部和不完整的线索,交互模式可能迅速变化,常常导致不稳定行为,如振荡性让行或不安全的承诺。现有的多智能体强化学习方法要么采用同步决策,这会加剧非平稳性,要么依赖于集中式排序机制,该机制随着交通密度增加而扩展性变差。为解决这些限制,我们提出了拓扑条件化Stackelberg协调(TSC),一种用于无通信执行下去中心化交互式驾驶的学习框架,该框架从轨迹之间的辫状启发编织关系中提取时变有向优先级图,从而在不构建全局博弈顺序的情况下定义局部领导者-跟随者依赖关系。以此图为条件,TSC将密集交互内在地分解为图局部Stackelberg子博弈,并在集中式训练与去中心化执行下,学习一种顺序协调策略,该策略通过动作预测来预判领导者,并通过动作条件化价值学习来训练跟随者以近似局部最优响应,从而提高了密集交通中的训练稳定性和安全性。在四个密集交通场景上的实验表明,TSC在关键指标上优于代表性的多智能体强化学习基线,最显著的是在保持有竞争力的交通效率和操控平顺性的同时减少了碰撞。

关键词

引用

@article{arxiv.2602.23896,
  title  = {TSC: Topology-Conditioned Stackelberg Coordination for Multi-Agent Reinforcement Learning in Interactive Driving},
  author = {Xiaotong Zhang and Gang Xiong and Yuanjing Wang and Siyu Teng and Alois Knoll and Long Chen},
  journal= {arXiv preprint arXiv:2602.23896},
  year   = {2026}
}

备注

12 pages, 8 figures