带公平性约束的组合睡眠赌博机
机器学习
2019-11-21 v3 性能
机器学习
摘要
多臂赌博机(MAB)模型已被广泛采用以研究许多具有未知参数的实际优化问题(网络资源分配、广告投放、众包等)。玩家目标是在不确定性下最大化累积奖励。然而,基本MAB模型忽略了众多真实应用中系统的若干重要因素,其中多个臂可同时拉动且某个臂有时会“睡眠”。此外,确保公平性也是实践中的关键设计考量。为此,我们提出一种新的带公平性约束的组合睡眠MAB模型,称为CSMAB-F,旨在解决上述关键建模问题。目标现变为在满足每个个体臂最小选择比例的公平性要求下最大化奖励。为处理这一新问题,我们扩展了一种在线学习算法UCB,以应对利用与探索之间的关键权衡,并采用虚拟队列技术恰当地处理公平性约束。通过细致整合这两种技术,我们为CSMAB-F问题开发了一种新算法,称为带公平性保证的学习(LFG)。进一步,我们严格证明LFG不仅是最优可行的,而且其时间平均后悔上界为,其中N为臂的总数,m为可同时拉动的最大臂数,T为时间范围,与为常数,为可调设计参数。最后,我们进行了大量仿真以证实所提算法的有效性。有趣的是,仿真结果揭示了后悔与收敛到满足公平性约束之点的速度之间的重要权衡。
引用
@article{arxiv.1901.04891,
title = {Combinatorial Sleeping Bandits with Fairness Constraints},
author = {Fengjiao Li and Jia Liu and Bo Ji},
journal= {arXiv preprint arXiv:1901.04891},
year = {2019}
}
备注
Fixed one minor mistake in the proofs, which impacts the constant $\beta_2$ in Theorem 2 only; Updated the reference by adding several highly relevant papers