中文

随机通信延迟下高速公路匝道汇入的延迟感知强化学习

机器人学 2026-05-28 v5 人工智能

摘要

延迟和部分可观测的状态信息对现实世界自动驾驶中基于强化学习(RL)的控制提出了重大挑战。在高速公路匝道汇入场景中,路侧单元(RSU)可以感知附近的交通,执行边缘感知,并通过车辆到基础设施(V2I)链路将状态估计传输给自车。随着智能交通基础设施和边缘计算的最新进展,这种 RSU 辅助感知越来越现实,并已在现代联网道路系统中部署。然而,边缘处理时间和无线传输可能会引入随机的 V2I 通信延迟,违反马尔可夫假设并显著降低控制性能。在本工作中,我们提出了 DAROM,一种对随机延迟具有鲁棒性的用于匝道汇入的延迟感知强化学习框架。我们将问题建模为随机延迟马尔可夫决策过程(RDMDP),并开发了一个用于联合纵向和横向控制的统一 RL 智能体。为了在延迟观测下恢复马尔可夫表示,我们引入了一个延迟感知编码器,该编码器以延迟观测、掩蔽动作历史和观测到的延迟幅度为条件来推断当前潜在状态。我们进一步集成了基于物理的安全控制器,以降低汇入过程中的碰撞风险。在 Simulation of Urban MObility (SUMO) 模拟器中使用来自 Next Generation Simulation (NGSIM) 数据集的真实交通数据进行的实验表明,DAROM 在不同交通密度下始终优于标准 RL 基线。特别是,基于门控循环单元(GRU)的编码器在高达 2.0 秒的随机 V2I 延迟的高密度交通中实现了超过 99% 的成功率。

关键词

引用

@article{arxiv.2403.11852,
  title  = {Delay-Aware Reinforcement Learning for Highway On-Ramp Merging under Stochastic Communication Latency},
  author = {Amin Tabrizian and Zhitong Huang and Arsyi Aziz and Peng Wei},
  journal= {arXiv preprint arXiv:2403.11852},
  year   = {2026}
}