AdaFair-MARL:在多智能体强化学习中强制执行自适应公平约束
机器学习
2026-04-27 v2 人工智能
计算机科学与博弈论
多智能体系统
摘要
在追求共同目标的异构多智能体系统中执行公平工作负载仍具有挑战性。固定公平惩罚常导致效率低下、训练不稳定以及冲突的智能体激励。基于奖励塑形的公平多智能体强化学习(MARL)方法通常通过启发式惩罚或标量奖励修改将公平性融入系统,常依赖事后评估。然而,这些方法不保证满足所需的公平水平。为此,我们提出自适应公平多智能体强化学习(AdaFair-MARL)框架,将工作负载公平性形式化为显式约束,使智能体在优化团队性能的同时维持平衡的贡献。我们 presented AdaFair-MARL,一个受约束的合作 MARL 框架,其核心算法组件是 primal-dual 更新,通过自适应拉格朗日乘子更新强制执行工作负载公平。基于合作马尔可夫游戏,我们从 Jain 公平指数(JFI)几何推导约束,表明可行集 admits 二阶锥表示,使无需人工惩罚调参即可实现原则化的拉格朗日对偶上升更新。 MARLHospital 模拟医院协作环境中的实验表明,AdaFair-MARL 相较于奖励塑形和固定惩罚的公平方法,有效提升了工作负载平衡,同时保持团队性能。我们发现 AdaFair-MARL 实现了近乎完美的约束满足(0.99-1.00),显著优于固定惩罚基线。
引用
@article{arxiv.2511.14135,
title = {AdaFair-MARL: Enforcing Adaptive Fairness Constraints in Multi-Agent Reinforcement Learning},
author = {Promise Ekpo and Saesha Agarwal and Felix Grimm and Lekan Molu and Angelique Taylor},
journal= {arXiv preprint arXiv:2511.14135},
year = {2026}
}