中文

面向公平多智能体社会福利优化的无后悔学习

机器学习 2024-06-03 v1 计算机科学与博弈论 多智能体系统 机器学习

摘要

我们考虑在线多智能体 Nash 社会福利(NSW)最大化问题。虽然 Hossain 等人 [2021]、Jones 等人 [2023] 的工作研究了类似问题,分别在随机多智能体多臂老虎机中表明可以在 T 轮后实现 T\sqrt{T} 级别的 regret,但他们的公平性度量是所有智能体奖励的乘积(即几何平均),而非 NSW。鉴于 NSW 在公平性文献中的根本作用,是否可能在 NSW 作为目标时实现无后悔公平学习,是一个自然的问题。本文在各种设置下提供了完整的答案。具体来说,在随机 N 智能体 K 臂老虎机中,我们开发了一个具有 O~(K2NTN1N)\widetilde{\mathcal{O}}\left(K^{\frac{2}{N}}T^{\frac{N-1}{N}}\right) 级别 regret 的算法,并证明了对 T 的依赖是紧致的,这与 Hossain 等人 [2021]、Jones 等人 [2023] 的 T\sqrt{T} 级别 regret 上界形成了尖锐的对比。随后,我们考虑更具挑战性的对抗性奖励问题。出人意料的是,尽管 NSW 是凸函数,我们证明了没有任何算法能实现亚线性 regret。为克服这种负面结果,我们进一步考虑完全信息反馈的设置,设计了两个具有 T\sqrt{T} 级别 regret 的算法:第一个算法对 N 完全没有依赖,适用于不仅限于 NSW 的广泛福利函数类;第二个算法对 K 的依赖更好,当 N 小时更可取。最后,我们还表明只要存在一个对不同臂位于同一水平上的智能体,就可以实现对数级 regret。

关键词

引用

@article{arxiv.2405.20678,
  title  = {No-Regret Learning for Fair Multi-Agent Social Welfare Optimization},
  author = {Mengxiao Zhang and Ramiro Deo-Campo Vuong and Haipeng Luo},
  journal= {arXiv preprint arXiv:2405.20678},
  year   = {2024}
}