混合 Q 学习用于车道变更:多智能体深度强化学习中的协作决策方法
人工智能
2025-10-27 v2 机器人学
摘要
车道变更决策是自动驾驶路径规划中的关键环节,面临规则约束和数据有限等实际挑战。深度强化学习因其在数据获取和可解释性方面的优势成为主要研究焦点。然而,当前模型常常忽视协作合作,这不仅影响整体交通效率,也阻碍车辆在长期内正常行驶。为此,本文提出一种名为 Mix Q-learning for Lane Changing(MQLC)的方法,集成混合价值 Q 网络,兼顾集体与个人收益,谋求公共利益最大化。在集体层面,方法通过利用全局信息协调个体 Q 网络和全局 Q 网络,使智能体能够有效平衡个人利益与集体收益。在个人层面,将基于深度学习的意图识别模块集成到观察中,并增强决策网络。这为智能体提供了更丰富的决策信息和更精准的特征提取,从而提高车道变更决策的质量。该策略使多智能体系统能够有效学习并制定最优决策策略。我们的 MQLC 模型通过大量实验表明,显著优于其他最先进的多智能体决策方法,实现了更安全更快速的车道变更决策。代码地址:https:github.com/pku-smart-city/source_code/tree/main/MQLC。
引用
@article{arxiv.2406.09755,
title = {Mix Q-learning for Lane Changing: A Collaborative Decision-Making Method in Multi-Agent Deep Reinforcement Learning},
author = {Xiaojun Bi and Mingjie He and Yiwen Sun},
journal= {arXiv preprint arXiv:2406.09755},
year = {2025}
}