中文

混合差分奖励:高效多智能体强化学习中的时序差分与动作梯度融合

人工智能 2025-11-24 v1

摘要

在涉及高频连续控制的多车协同驾驶任务中,传统基于状态的奖励函数存在奖励差分消失的问题,这导致策略梯度的信噪比(SNR)偏低,显著阻碍算法的收敛与性能提升。为解决这一挑战,本文提出一种新型混合差分奖励(Hybrid Differential Reward, HDR)机制。我们首先理论阐明了交通状态的时序准稳态特性与动作物理接近性如何导致传统奖励信号失效。基于此分析,HDR框架创新性地整合了两个互补组件:(1) 基于全局势函数的时序差分奖励(TRD),利用势能的演化趋势确保最优策略不变性并与长期目标一致;(2) 动作梯度奖励(ARG),直接衡量动作的边际效用,提供高SNR的局部引导信号。此外,我们将协同驾驶问题形式化为集合随时间变化的多智能体部分可观测马尔可夫游戏(POMDPG),并在该框架下提供HDR的完整实现方案。在大量实验中,我们使用在线规划(MCTS)和多智能体强化学习(QMIX, MAPPO, MADDPG)算法验证,HDR机制显著提升了收敛速度与策略稳定性。结果表明,HDR引导智能体学习高质量的协同策略,有效平衡了交通效率与安全。

关键词

引用

@article{arxiv.2511.16916,
  title  = {Hybrid Differential Reward: Combining Temporal Difference and Action Gradients for Efficient Multi-Agent Reinforcement Learning in Cooperative Driving},
  author = {Ye Han and Lijun Zhang and Dejian Meng and Zhuang Zhang},
  journal= {arXiv preprint arXiv:2511.16916},
  year   = {2025}
}