中文

C$^2$T:基于车流-车协调的 captioning-结构和 LLM 对齐常识奖励学习

多智能体系统 2026-04-16 v1 计算机视觉与模式识别 机器人学

摘要

当前 SOTA 城市交通控制日益依赖多主体强化学习(MARL)来协调交通灯控制器(TLCs)和联合自动驾驶车辆(CAVs)。然而,这些系统的性能基本受限于其手工设计、浅显的奖励函数(如交叉口压力),这些奖励无法捕捉类似安全、流稳定性和舒适性等高层次、以人为中心的目标。为克服这一限制,我们提出 C2T 框架,从车流-车动态中学习常识协调模型。C2T 将来自大型语言模型(LLM)的“常识”知识蒸馏到所学习的内在奖励函数中。该新奖励随后用于指导基于 CityFlow 多交叉口基准测试上的协同型多交叉口 TLC MARL 系统的协调策略。我们的框架在交通效率、安全性以及能源相关代理指标方面显著优于强大的 MARL 基线。我们进一步突出 C2T 的原则灵活性,通过修改 LLM 提示符实现不同的“以效率为导向”或“以安全为导向”策略。

关键词

引用

@article{arxiv.2604.13098,
  title  = {C$^2$T: Captioning-Structure and LLM-Aligned Common-Sense Reward Learning for Traffic--Vehicle Coordination},
  author = {Yuyang Chen and Kaiyan Zhao and Yiming Wang and Ming Yang and Bin Rao and Zhenning Li},
  journal= {arXiv preprint arXiv:2604.13098},
  year   = {2026}
}

备注

Accepted to CVPR 2026 Findings Track