深度神经网络演化智能方法在去中心化多智能体强化学习中的有限时间全局最优收敛
机器学习
2025-08-14 v2 多智能体系统
摘要
针对去中心化多智能体强化学习(MARL)的演化智能方法,能够在无中心化协调的情况下实现协作式最优决策,从而在实际中支持广泛的应用。然而,目前大多数演化智能去中心化MARL方法的理论收敛研究仅限于线性函数逼近下的平稳解保证,这在实际应用中使用深度神经网络演化智能方法的成功与当前理论认识之间留下了显著的鸿沟。为弥合这一差距,本文首次发展一种用于去中心化MARL的深度神经网络演化智能方法,其中演化器和批评家组件均为内在非线性。我们证明,我们提出的方法具有全局最优保证,并以O(1/T)的有限时间收敛率,其中T为总迭代次数。这标志着MARL文献中首个关于深度神经网络演化智能方法的全局收敛结果。我们还进行了大量数值实验,验证了我们的理论结果。
引用
@article{arxiv.2505.18433,
title = {Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning},
author = {Zhiyao Zhang and Myeung Suk Oh and FNU Hairi and Ziyue Luo and Alvaro Velasquez and Jia Liu},
journal= {arXiv preprint arXiv:2505.18433},
year = {2025}
}