随机多臂老虎机问题中的公平性实现
机器学习
2019-07-24 v3 机器学习
摘要
我们研究随机多臂老虎机问题的一个有趣变体,称为 Fair-SMAB 问题,其中要求每个臂被拉动的次数至少占总可用轮次的给定比例。我们根据表示保证拉动比例的前指定向量,研究学习与公平性之间的相互作用。我们定义了一种公平性感知遗憾,称为 r-Regret,它考虑了上述公平性约束并自然扩展了传统的遗憾概念。我们的主要贡献是通过两个参数刻画一类 Fair-SMAB 算法:不公平容忍度和用作黑盒的学习算法。我们为该类提供了随时间一致成立的公平性保证,与学习算法的选择无关。特别地,当学习算法为 UCB1 时,我们证明我们的算法实现了 O(log(T)) 的 r-Regret。最后,我们根据传统遗憾概念评估公平性的代价。
引用
@article{arxiv.1905.11260,
title = {Achieving Fairness in Stochastic Multi-armed Bandit Problem},
author = {Vishakha Patil and Ganesh Ghalme and Vineet Nair and Y. Narahari},
journal= {arXiv preprint arXiv:1905.11260},
year = {2019}
}
备注
Uploading the latest version with significant improvements