中文

无需在线探索的紧急抢占:基于决策转换器的方案

机器学习 2026-03-25 v1 人工智能

摘要

紧急车辆(EV)响应时间是决定生存结果的关键因素,但现有的信号抢占策略仍停留在被动且不可控的水平。我们提出一种基于决策转换器(Decision Transformer, DT)的返回条件框架,用于紧急走廊优化。通过将走廊优化问题建模为离线、返回条件的序列建模,我们的方案(1)消除了策略学习期间与环境的在线交互,(2)通过单个目标返回标量实现调度层级的紧急程度控制,(3)通过图注意力实现空间协调的多主体决策转换器(MADT)。在LightSim模拟器上,DT相对于4x4网格上的固定时序抢占将平均EV行驶时间缩短37.7%(88.6秒 vs. 142.3秒),在所有方法中实现最低的市民延迟(11.3秒/车)和最少的EV停止次数(1.2次),其中包括需要环境交互的在线强化学习基线方法。MADT在更大的网格上进一步优化,通过图注意力协调在8x8网格上实现45.2%的降幅。返回条件化可产生平滑的调度界面:当目标返回从100调节至-400时,EV行驶时间(72.4-138.2秒)与市民延迟(16.8-5.4秒/车)呈比例变化,无需重新训练。受限DT扩展版本将市民干扰预算作为第二个控制杆。

关键词

引用

@article{arxiv.2603.22315,
  title  = {Emergency Preemption Without Online Exploration: A Decision Transformer Approach},
  author = {Haoran Su and Hanxiao Deng and Yandong Sun},
  journal= {arXiv preprint arXiv:2603.22315},
  year   = {2026}
}