OracleTSC:基于Oracle信息的奖励 hurdles 与不确定性正则化的交通信号控制
人工智能
2026-05-12 v1
摘要
透明的决策过程对交通信号控制(TSC)系统至关重要,以赢得公众信任。然而,传统基于强化学习的TSC方法常被视为黑箱,解释性有限。尽管大语言模型(LLM)能够提供自然语言推理,但基于LLM的TSC强化微调仍不稳定,因为反馈稀疏且延迟,而大多数动作仅对拥堵指标产生边际变化。我们引入OracleTSC,通过两种机制稳定LLM-based TSC:(1)奖励hurdles机制通过减去校准阈值来过滤弱学习信号,(2)不确定性正则化最大化所选响应的概率,以鼓励跨采样输出的一致决策。在LibSignal基准测试中,OracleTSC使紧凑型LLaMA3-8B模型显著提升交通效率,实现旅行时间降低75%、排队长度降低67%,同时通过自然语言解释保持可解释性。OracleTSC还显示出强大的跨路口泛化能力:在一个路口训练的策略可在结构不同的路口上无需额外微调,实现旅行时间降低17%、排队长度降低39%。这些结果表明,不确定性感知的奖励塑形可改善TSC强化微调的稳定性和有效性。
引用
@article{arxiv.2605.08516,
title = {OracleTSC: Oracle-Informed Reward Hurdle and Uncertainty Regularization for Traffic Signal Control},
author = {Darryl Jacob and Xinyu Liu and Muchao Ye and Xiaoyong Yuan and Pan He},
journal= {arXiv preprint arXiv:2605.08516},
year = {2026}
}
备注
Published in Transactions on Machine Learning Research