中文

交通专家知识结合残差 RL:面向 CAV 轨迹控制的知识驱动基于模型残差强化学习

人工智能 2026-01-19 v2 机器学习

摘要

基于模型的强化学习(RL)通过利用虚拟环境模型,有望比无模型 RL 展现出更高的样本效率。然而,由于复杂系统和环境中的不确定性,获得足够准确的环境动力学表征具有挑战性。不准确的环境模型可能会降低基于模型 RL 的样本效率和性能。此外,尽管基于模型的 RL 可以提高样本效率,但通常仍需要大量的训练时间从零开始学习,这可能限制其相对于无模型方法的优势。为了应对这些挑战,本文引入了一个知识驱动的基于模型残差强化学习框架,旨在通过将既定的专家知识融入学习过程并避免从零开始的问题来提高学习效率。我们的方法将交通专家知识整合到虚拟环境模型中,采用智能驾驶员模型(IDM)描述基础动力学,并使用神经网络描述残差动力学,从而确保对复杂场景的适应性。我们提出了一种将传统控制方法与残差 RL 相结合的新策略,促进了高效学习和策略优化,而无需从零开始学习。所提出的方法应用于混合交通流中用于消除走走停停波的 CAV 轨迹控制任务。实验结果表明,在样本效率、交通流平滑度和交通流动性方面,我们提出的方法使 CAV 智能体在轨迹控制上实现了优于基线智能体的性能。源代码和补充材料可在以下网址获取:https://zihaosheng.github.io/traffic-expertise-RL/。

关键词

引用

@article{arxiv.2408.17380,
  title  = {Traffic expertise meets residual RL: Knowledge-informed model-based residual reinforcement learning for CAV trajectory control},
  author = {Zihao Sheng and Zilin Huang and Sikai Chen},
  journal= {arXiv preprint arXiv:2408.17380},
  year   = {2026}
}

备注

Accepted by Communications in Transportation Research