中文

基于 Shapley 值的预算约束组合多臂赌博机中的功绩公平

机器学习 2026-05-04 v1 人工智能 多智能体系统

摘要

我们提出一种新的框架,用于在预算约束下的组合多臂赌博机中实现功绩公平,采用完全bandit反馈 (BCMAB-FBF)。不同于半bandit 反馈,单个臂的贡献在完全bandit 反馈中无法获得,这使得该设置显著更具挑战性。为了计算 BCMAB-FBF 中的臂贡献,我们首先将协作博弈论中的经典解决方案概念 Shapley 值扩展为 KK-Shapley 值,这捕获受集合大小至多为 KK 的代理贡献。我们证明 KK-Shapley 值是满足对称性、线性、空玩家和效率属性的唯一解决方案。接着,我们提出 K-SVFair-FBF,一种面向功绩公平的bandit算法,通过自适应估计未知评估函数的 KK-Shapley 值。不同于标准bandit文献中的完全反馈,K-SVFair-FBF不仅在完全反馈设置下学习评估函数,还减轻了蒙特卡罗近似产生的噪声。理论上,我们证明 K-SVFair-FBF 在功绩 regret 上实现 O(T3/4)O(T^{3/4}) regret 界。通过在联邦学习和社交影响最大化数据集上的实验,我们展示我们的做法在实现功绩公平方面优于现有基准。

关键词

引用

@article{arxiv.2605.00762,
  title  = {Meritocratic Fairness in Budgeted Combinatorial Multi-armed Bandits via Shapley Values},
  author = {Shradha Sharma and Swapnil Dhamal and Shweta Jain},
  journal= {arXiv preprint arXiv:2605.00762},
  year   = {2026}
}