多臂老虎机中的校准公平性
机器学习
2017-07-07 v1
摘要
我们在随机多臂老虎机(\emph{multi-armed bandit}, MAB)决策框架内研究公平性。我们将“相似个体相似对待”的公平性框架调整至该设置。此处,一个‘个体’对应于一个臂(arm),若两个臂具有相似的质量分布,则它们是‘相似’的。首先,我们采用一种{\em smoothness constraint}(平滑约束),即若两个臂具有相似的质量分布,则选择每个臂的概率应相似。此外,我们定义了{\em fairness regret}(公平性后悔),它对应于算法未被校准的程度,其中完美校准要求选择某臂的概率等于该臂具有最佳质量实现的概率。我们展示了Thompson采样的一个变体满足全变距离下的平滑公平性,并给出了公平性后悔的 界。这补充了先前的工作,后者保护平均上更优的臂不被较少青睐。我们还解释了如何将我们的算法扩展到对决老虎机(dueling bandit)设置。
引用
@article{arxiv.1707.01875,
title = {Calibrated Fairness in Bandits},
author = {Yang Liu and Goran Radanovic and Christos Dimitrakakis and Debmalya Mandal and David C. Parkes},
journal= {arXiv preprint arXiv:1707.01875},
year = {2017}
}
备注
To be presented at the FAT-ML'17 workshop