超越单调性:多智能体 Q 学习中分解原则的再思考
机器学习
2026-03-23 v1 多智能体系统
摘要
价值分解是多智能体强化学习(MARL)中的核心方法,通过将全局值函数分解为局部值来实现集中训练与分布式执行。为确保 individual-global-max(IGM)一致性,现有方法要么强制执行单调性约束,这会限制表征能力,要么采用较软的替代方案,却增加算法复杂度。本文对非单调价值分解进行动力系统分析,将学习动力学建模为连续时间的梯度流。我们证明,在大约的贪心探索下,所有违反 IGM 一致性的零损失平衡点都是不稳定的鞍点,而只有 IGM-一致解是学习动力学的稳定吸引子。在合成矩阵游戏和具有挑战性的 MARL 基准上进行大量实验表明,无约束的非单调分解可靠地恢复 IGM 最优解,并持续超越单调基线。此外,我们研究了时序差分目标和探索策略的影响,为未来基于价值的 MARL 算法设计提供了可操作的见解。
引用
@article{arxiv.2511.09792,
title = {Beyond Monotonicity: Revisiting Factorization Principles in Multi-Agent Q-Learning},
author = {Tianmeng Hu and Yongzheng Cui and Rui Tang and Biao Luo and Ke Li},
journal= {arXiv preprint arXiv:2511.09792},
year = {2026}
}
备注
Accepted at AAAI 2026