社会公平强化学习
机器学习
2023-02-06 v2 计算机与社会
计算机科学与博弈论
多智能体系统
摘要
我们考虑具有多个具有不同奖励函数的利益相关者的 episodic 强化学习问题。我们的目标是输出一个关于不同奖励函数社会公平的策略。先前的工作提出了公平策略必须优化的不同目标,包括最小福利和广义 Gini 福利。我们首先从公理化视角看待该问题,并提出任何此类公平目标必须满足的四个公理。我们证明 Nash 社会福利是唯一满足全部四个目标的唯一目标,而先前的目标未能满足所有四个公理。然后我们考虑底层模型即马尔可夫决策过程未知的学习版本问题。我们考虑针对最大化三种不同公平目标——最小福利、广义 Gini 福利和 Nash 社会福利——的公平策略最小化 regret 的问题。基于乐观规划,我们提出了一个通用学习算法,并推导了相对于这三种不同策略的 regret 界。对于 Nash 社会福利目标,我们还推导了随 (智能体数量)指数增长的 regret 下界。最后,我们证明对于最小福利目标,对于一种较弱的 regret 概念,可将 regret 改进 倍。
引用
@article{arxiv.2208.12584,
title = {Socially Fair Reinforcement Learning},
author = {Debmalya Mandal and Jiarui Gan},
journal= {arXiv preprint arXiv:2208.12584},
year = {2023}
}