中文

社会公平强化学习

机器学习 2023-02-06 v2 计算机与社会 计算机科学与博弈论 多智能体系统

摘要

我们考虑具有多个具有不同奖励函数的利益相关者的 episodic 强化学习问题。我们的目标是输出一个关于不同奖励函数社会公平的策略。先前的工作提出了公平策略必须优化的不同目标,包括最小福利和广义 Gini 福利。我们首先从公理化视角看待该问题,并提出任何此类公平目标必须满足的四个公理。我们证明 Nash 社会福利是唯一满足全部四个目标的唯一目标,而先前的目标未能满足所有四个公理。然后我们考虑底层模型即马尔可夫决策过程未知的学习版本问题。我们考虑针对最大化三种不同公平目标——最小福利、广义 Gini 福利和 Nash 社会福利——的公平策略最小化 regret 的问题。基于乐观规划,我们提出了一个通用学习算法,并推导了相对于这三种不同策略的 regret 界。对于 Nash 社会福利目标,我们还推导了随 nn(智能体数量)指数增长的 regret 下界。最后,我们证明对于最小福利目标,对于一种较弱的 regret 概念,可将 regret 改进 O(H)O(H) 倍。

关键词

引用

@article{arxiv.2208.12584,
  title  = {Socially Fair Reinforcement Learning},
  author = {Debmalya Mandal and Jiarui Gan},
  journal= {arXiv preprint arXiv:2208.12584},
  year   = {2023}
}