中文

证明收敛的风险厌恶多智能体强化学习 Actor-Critic 方法

多智能体系统 2026-02-16 v1 计算机科学与博弈论 机器学习

摘要

在无限时域一般和博弈中学习 stationary 策略是多智能体强化学习 (MARL) 中的一个根本性开放问题。虽然 stationary 策略因其实用性而受到青睞,但计算经典博弈论均衡的 stationary 形式计算上难以置疑——这与单智能体强化学习或零和博弈求解的相对容易形成鲜明对比。为弥合这一差距,我们研究了风险厌恤量子响应均衡 (RQE),这是一种根植于行为博弈论、融合风险厌恤与有限理性的解决方案概念。我们展示了 RQE 具备强大的正则化条件,使其在 MG 中学习具有独特性。我们提出了一种新颖的两时序 Actor-Critic 方法,特点是快速时序的 actor 和慢时序的 critic。凭借 RQE 的正则化,我们证明了该方法实现全局收敛并具备有限样本保证。我们在多个环境中对算法进行实证验证,以证明其在面对风险中性基线时表现出优越的收敛性。

关键词

引用

@article{arxiv.2602.12386,
  title  = {Provably Convergent Actor-Critic in Risk-averse MARL},
  author = {Yizhou Zhang and Eric Mazumdar},
  journal= {arXiv preprint arXiv:2602.12386},
  year   = {2026}
}