中文

基于深度强化学习的多时间尺度控制与通信——第一部分:通信感知的车辆控制

系统与控制 2023-11-21 v1 机器学习 系统与控制

摘要

由车辆到一切(V2X)通信赋能的智能决策系统对于实现安全高效的自动驾驶(AD)至关重要,其中必须在不同时间尺度上做出两类决策,即车辆控制与无线资源分配(RRA)决策。RRA与车辆控制之间的相互作用要求二者协同设计。在这篇由两部分组成的论文(第一部分和第二部分)中,以编队控制(PC)为例用例,我们提出了一种基于深度强化学习(DRL)的多时间尺度控制与通信(MTCC)联合优化框架。本文(第一部分)中,我们首先将问题分解为基于通信感知DRL的PC子问题与基于控制感知DRL的RRA子问题。随后,在给定RRA策略的假设下聚焦于PC子问题,并提出MTCC-PC算法以学习高效的PC策略。为提升随机观测延迟下的PC性能,PC状态空间被扩充了观测延迟与PC动作历史。此外,针对扩充状态定义了奖励函数,从而构造出扩充状态马尔可夫决策过程(MDP)。证明了该扩充状态MDP的最优策略对于带观测延迟的原始PC问题亦为最优。与大多数现有通信感知控制工作不同,MTCC-PC算法是在由C-V2X通信细粒度嵌入式仿真生成的延迟环境中训练,而非简单的随机延迟模型。最后,通过实验将MTCC-PC与基线DRL算法的性能进行了比较。

关键词

引用

@article{arxiv.2311.11281,
  title  = {Multi-Timescale Control and Communications with Deep Reinforcement Learning -- Part I: Communication-Aware Vehicle Control},
  author = {Tong Liu and Lei Lei and Kan Zheng and Xuemin and Shen},
  journal= {arXiv preprint arXiv:2311.11281},
  year   = {2023}
}