中文

多目标多智能体老虎机:从学习效率到公平性优化

机器学习 2026-05-11 v1

摘要

我们研究了随机奖励下的多目标多智能体多臂老虎机(MO-MA-MAB),其中智能体观察异构奖励向量并在时变图上进行通信。我们构建了这一新兴问题设定,以解决以 Pareto 遗憾度衡量的高效学习,并将公平学习作为通过社会福利捕获的额外目标。为了衡量效率,我们构建了 Pareto 遗憾度并开发了 \textsc{Pareto UCB1 Gossip},其新颖的探索半径明确地将基于 Pareto 推断的统计不确定性与共识误差分离开来。为了表达公平性约束,我们在偏好标量化奖励上构建了 Nash 社会福利目标,并提出了 \textsc{Simulated NSW UCB Gossip},它集成了基于偏好的奖励模拟、基于 Gossip 的效用估计和 UCB 式探索。我们证明 \textsc{Pareto UCB1 Gossip} 实现了 O(logT)\mathcal{O}(\log T) 的遗憾度和 O(T)\mathcal{O}(\sqrt{T}) 的实例无关率,而 \textsc{Simulated NSW UCB Gossip} 实现了 O(T3/4)\mathcal{O}(T^{3/4}) 的实例无关遗憾界。这种分离揭示了将公平性约束施加于我们的效率目标上的代价:公平性限制了信息聚合并减慢了收敛速度。实验表明,我们的方法始终优于基线,在效率设定和公平性设定下分别将性能提高了约 100%100\%50%50\%

关键词

引用

@article{arxiv.2605.06864,
  title  = {Multi-Objective Multi-Agent Bandits: From Learning Efficiency to Fairness Optimization},
  author = {John Wang and Mengfan Xu},
  journal= {arXiv preprint arXiv:2605.06864},
  year   = {2026}
}