使用强化学习在多智能体马尔可夫决策过程中实现公平性
机器学习
2023-06-02 v1 多智能体系统
摘要
公平性在各种多智能体系统(例如通信网络、金融市场等)中起着关键作用。许多多智能体动态交互可建模为马尔可夫决策过程(MDPs)。虽然现有研究聚焦于已知环境中的公平性,但在此类系统中探索未知环境的公平性仍属开放问题。本文提出一种强化学习(RL)方法,以在多智能体有限 horizon 情节式MDP中实现公平性。我们引入一个公平性函数以确保各智能体间奖励公平,而非最大化个体智能体价值函数之和。由于当不最大化个体价值函数之和时经典贝尔曼方程不成立,我们无法使用传统方法。相反,为进行探索,我们维护未知环境的置信界,然后提出一种基于在线凸优化的方法以获得约束于该置信区域的策略。我们证明该方法在情节数方面实现了次线性后悔(sub-linear regret)。此外,基于所得后悔界我们提供了可能近似正确(PAC)保证。我们还提出一种离线RL算法,并界定了相对于最优公平解的 optimality gap。为缓解计算复杂度,我们引入一种针对公平目标的策略梯度类方法。仿真实验也证明了我们方法的有效性。
引用
@article{arxiv.2306.00324,
title = {Achieving Fairness in Multi-Agent Markov Decision Processes Using Reinforcement Learning},
author = {Peizhong Ju and Arnob Ghosh and Ness B. Shroff},
journal= {arXiv preprint arXiv:2306.00324},
year = {2023}
}