中文

演化发现交通信号灯的启发式策略

人工智能 2025-12-01 v1

摘要

交通信号灯控制 (TSC) 涉及一个具有挑战性的权衡:经典启发式方法高效但过于简化,而深度强化学习 (DRL) 虽实现高性能,却存在泛化性差和策略不透明的问题。在线大型语言模型 (LLM) 提供通用推理能力,但因延迟高且缺乏环境特定的优化。为此,我们提出了 Temporal Policy Evolution for Traffic (\textbf{\method{}}),利用 LLM 作为演化引擎推导出针对特定交通环境优化的专业化启发式策略。该框架引入了两个关键模块:(1) 结构化状态抽象 (SSA),将高维交通数据转换为用于推理的时序逻辑事实;(2) 信用分配反馈 (CAF),追踪微观决策错误导致的宏观结果,以实现针对性批评。完全基于提示词的操作无需训练,\method{} 产生轻量级、稳健的策略,为特定交通环境优化,超越启发式方法和在线 LLM 参与者。

关键词

引用

@article{arxiv.2511.23122,
  title  = {Evolutionary Discovery of Heuristic Policies for Traffic Signal Control},
  author = {Ruibing Wang and Shuhan Guo and Zeen Li and Zhen Wang and Quanming Yao},
  journal= {arXiv preprint arXiv:2511.23122},
  year   = {2025}
}