带公平性约束的非平稳多臂老虎机的后悔界
机器学习
2020-12-25 v1 人工智能
摘要
多臂老虎机框架是研究序贯决策问题策略的最常见平台。近来,公平性概念在机器学习界备受关注。人们可施加公平性条件:在任何时刻,即便在学习阶段,表现差的候选也不应被优先于表现好的候选。该公平性约束被认为是最严格的约束之一,并已在平稳设置下的随机多臂老虎机框架中被研究,且已建立后悔界。本文主要目标是在非平稳设置中研究此问题。我们提出一种称为带探索的公平上置信界(Fair-UCBe)的新算法,用于求解缓慢变化的随机 臂老虎机问题。据此我们给出两个结果:(i)Fair-UCBe 确实满足上述公平性条件;(ii)对某个合适的 ,它达到 的后悔界,其中 为时间范围。据我们所知,这是首个适用于非平稳老虎机且具有次线性后悔界的公平算法。我们展示了当环境变化趋于零时,我们的算法在非平稳情形下的性能趋近于其平稳对应情形。
引用
@article{arxiv.2012.13380,
title = {A Regret bound for Non-stationary Multi-Armed Bandits with Fairness Constraints},
author = {Shaarad A. R and Ambedkar Dukkipati},
journal= {arXiv preprint arXiv:2012.13380},
year = {2020}
}