LLM引导的可解释交通信号控制技能进化综合
人工智能
2026-04-08 v1
摘要
交通信号控制TSC需要具备有效性和可解释性的策略以便部署,但强化学习产生的神经策略不透明,而程序综合则依赖限制性的领域特定语言。我们提出SIGNALCLAW,一个利用大型语言模型LLM作为进化技能生成器的框架,用于合成和细化自适应TSC的可解释控制技能。每个技能包括理由、选择指导和可执行代码,使政策人类可检查且自我文档化。在每次生成时,通过仿真指标如队列百分位、延迟趋势和停滞情况转化为自然语言反馈以引导改进。SignalClaw还引入事件驱动的组合进化:事件检测器通过TraCI识别紧急车辆、公交优先、事故和拥堵,并由优先级调度器选择专用技能。每个技能独立进化,优先级链 enables 运行时组合而无需重新训练。我们在常规和事件注入的SUMO情境中对SignalClaw进行评估,分别与四个基线方法进行比较。在常规情境下,它实现了平均延迟为7.8至9.2秒,仅比最佳方法高出3%至10%,且在随机种子间波动较小。在事件情境下,它实现了最低的紧急延迟11.2至18.5秒,分别相对于MaxPressure的42.3至72.3秒和DQN的78.5至95.3秒,以及最低的公交人员延迟9.8至11.5秒,分别相对于MaxPressure的38.7至45.2秒。在混合事件场景中,调度器能够有效组合技能,同时保持整体延迟稳定。进化出的技能从简单的线性规则发展到带有多特征相互作用的条件策略,同时保持完全可解释且可由交通工程师直接修改。
引用
@article{arxiv.2604.05535,
title = {SignalClaw: LLM-Guided Evolutionary Synthesis of Interpretable Traffic Signal Control Skills},
author = {Da Lei and Feng Xiao and Lu Li and Yuzhan Liu},
journal= {arXiv preprint arXiv:2604.05535},
year = {2026}
}