中文

bandit max-min 公平分配

机器学习 2025-05-09 v1

摘要

本文研究了一种称为bandit max-min 公平分配(BMMFA)的新决策问题。该问题旨在通过重复分配不可分割的物品来最大化代理人(具有可加价值)之间最小效用。该问题的关键特征之一是,每个代理人的物品价值只能通过准半bandit反馈来观察,而现有工作则假设物品价值在每个回合开始时提供。另一个关键特征是,该算法的奖励函数不像大多数bandit设置问题那样是随回合数可加的。我们的第一项贡献是提出了一个具有渐近后悔上界的算法,上界为O(mTlnT/n+mTln(mnT))O(m\sqrt{T}\ln T/n + m\sqrt{T \ln(mnT)}),其中n为代理人数量,m为物品数量,T为时间范围。该算法基于bandit技术与文献中研究的资源分配算法的一种新型组合。我们的第二项贡献是提供了后悔下界为Ω(mT/n)\Omega(m\sqrt{T}/n)。当T显著大于n时,上界和下界之间仅相差一个对T的对数因子。

关键词

引用

@article{arxiv.2505.05169,
  title  = {Bandit Max-Min Fair Allocation},
  author = {Tsubasa Harada and Shinji Ito and Hanna Sumita},
  journal= {arXiv preprint arXiv:2505.05169},
  year   = {2025}
}

备注

23 pages