中文

在随机多臂老虎机问题中实现公平性

机器学习 2020-02-06 v2 机器学习

摘要

我们研究随机多臂老虎机问题的一个有趣变体,称为公平-SMAB问题,其中要求每个臂被拉取的次数至少占总可用轮次的给定比例。我们依据表示保证拉取比例的前指定向量,研究学习与公平性之间的相互作用。我们定义了一种公平性感知遗憾,称为rr-Regret,其考虑了上述公平性约束并自然扩展了传统的遗憾概念。我们的主要贡献是通过两个参数刻画了一类Fair-SMAB算法:不公平容忍度和用作黑盒的学习算法。我们为该类算法提供了随时间一致成立的公平性保证,而与学习算法的选择无关。特别地,当学习算法为UCB1时,我们证明我们的算法实现了O(lnT)O(\ln T)rr-Regret。最后,我们依据传统遗憾概念评估了公平性的代价。

关键词

引用

@article{arxiv.1907.10516,
  title  = {Achieving Fairness in the Stochastic Multi-armed Bandit Problem},
  author = {Vishakha Patil and Ganesh Ghalme and Vineet Nair and Y. Narahari},
  journal= {arXiv preprint arXiv:1907.10516},
  year   = {2020}
}

备注

arXiv admin note: substantial text overlap with arXiv:1905.11260