中文

多臂老虎机中遗憾的公平性与福利量化

机器学习 2022-05-30 v1 计算机科学与博弈论

摘要

我们从福利主义视角拓展了遗憾的概念。聚焦于经典多臂老虎机(MAB)框架,本工作通过应用一种基本福利函数即纳什社会福利(NSW)函数来量化老虎机算法的性能。这相当于将算法性能等同于其期望奖励的几何平均,并引导我们研究纳什遗憾,定义为——先验未知——最优均值(各臂中)与算法性能之差。由于 NSW 已知满足公平性公理,我们的方法补充了平均(累积)遗憾的功利主义考量,后者通过期望奖励的算术平均评价算法。本工作开发了一种算法,给定博弈时域 TT,实现 O(klogTT)O \left( \sqrt{\frac{{k \log T}}{T}} \right) 的纳什遗憾,其中 kk 表示 MAB 实例中的臂数。由于对任意算法,纳什遗憾至少与其平均遗憾相当(AM-GM 不等式),已知的平均遗憾下界对纳什遗憾同样成立。因此,我们的纳什遗憾保证本质上是紧的。此外,我们开发了一种 anytime 算法,其纳什遗憾保证为 O(klogTTlogT)O \left( \sqrt{\frac{{k\log T}}{T}} \log T \right)

关键词

引用

@article{arxiv.2205.13930,
  title  = {Fairness and Welfare Quantification for Regret in Multi-Armed Bandits},
  author = {Siddharth Barman and Arindam Khan and Arnab Maiti and Ayush Sawarni},
  journal= {arXiv preprint arXiv:2205.13930},
  year   = {2022}
}

备注

32 pages