突破价值分解基于多主体强化学习中的亚最优稳定点
人工智能
2026-04-08 v1
摘要
价值分解是多主体强化学习中的流行范式,但面临着显著的理论和算法瓶颈:其倾向于收敛到亚最优解的问题尚未得到充分理解和解决。理论上,现有分析因主要关注最优情况而无法解释这一问题。为弥合这一差距,我们引入一种新型理论概念:稳定点,这一概念刻画了价值分解在一般情况下的收敛潜力。在对现有方法中稳定点分布进行分析后,我们揭示了非最优稳定点是导致性能差异的主要原因。然而,在算法层面上,将最优动作为唯一稳定点几乎不可行。相反,通过使次优动作不稳定而迭代过滤次优动作,成为实现全局最优性的更为可行的方法。鼓舞此思路,我们提出一种新型多轮价值分解 (MRVF) 框架。具体而言,通过相对于先前选取的动作衡量非负收益增量,MRVF 将劣势动作转换为不稳定点,从而推动每个迭代趋向具有更优动作的稳定点。在包括捕食者-猎物任务和星际战争多主体挑战 (SMAC) 等具有挑战性的基准测试上进行的实验验证了我们的稳定点分析,并表明 MRVF 在与最新方法相比具有优势。
引用
@article{arxiv.2604.05297,
title = {Breakthrough the Suboptimal Stable Point in Value-Factorization-Based Multi-Agent Reinforcement Learning},
author = {Lesong Tao and Yifei Wang and Haodong Jing and Jingwen Fu and Miao Kang and Shitao Chen and Nanning Zheng},
journal= {arXiv preprint arXiv:2604.05297},
year = {2026}
}