在随机多臂老虎机问题中实现公平性
机器学习
2020-02-06 v2 机器学习
摘要
我们研究随机多臂老虎机问题的一个有趣变体,称为公平-SMAB问题,其中要求每个臂被拉取的次数至少占总可用轮次的给定比例。我们依据表示保证拉取比例的前指定向量,研究学习与公平性之间的相互作用。我们定义了一种公平性感知遗憾,称为-Regret,其考虑了上述公平性约束并自然扩展了传统的遗憾概念。我们的主要贡献是通过两个参数刻画了一类Fair-SMAB算法:不公平容忍度和用作黑盒的学习算法。我们为该类算法提供了随时间一致成立的公平性保证,而与学习算法的选择无关。特别地,当学习算法为UCB1时,我们证明我们的算法实现了的-Regret。最后,我们依据传统遗憾概念评估了公平性的代价。
引用
@article{arxiv.1907.10516,
title = {Achieving Fairness in the Stochastic Multi-armed Bandit Problem},
author = {Vishakha Patil and Ganesh Ghalme and Vineet Nair and Y. Narahari},
journal= {arXiv preprint arXiv:1907.10516},
year = {2020}
}
备注
arXiv admin note: substantial text overlap with arXiv:1905.11260