中文

随机多臂老虎机问题中的公平性实现

机器学习 2019-07-24 v3 机器学习

摘要

我们研究随机多臂老虎机问题的一个有趣变体,称为 Fair-SMAB 问题,其中要求每个臂被拉动的次数至少占总可用轮次的给定比例。我们根据表示保证拉动比例的前指定向量,研究学习与公平性之间的相互作用。我们定义了一种公平性感知遗憾,称为 r-Regret,它考虑了上述公平性约束并自然扩展了传统的遗憾概念。我们的主要贡献是通过两个参数刻画一类 Fair-SMAB 算法:不公平容忍度和用作黑盒的学习算法。我们为该类提供了随时间一致成立的公平性保证,与学习算法的选择无关。特别地,当学习算法为 UCB1 时,我们证明我们的算法实现了 O(log(T)) 的 r-Regret。最后,我们根据传统遗憾概念评估公平性的代价。

关键词

引用

@article{arxiv.1905.11260,
  title  = {Achieving Fairness in Stochastic Multi-armed Bandit Problem},
  author = {Vishakha Patil and Ganesh Ghalme and Vineet Nair and Y. Narahari},
  journal= {arXiv preprint arXiv:1905.11260},
  year   = {2019}
}

备注

Uploading the latest version with significant improvements