中文

带公平性约束的非平稳多臂老虎机的后悔界

机器学习 2020-12-25 v1 人工智能

摘要

多臂老虎机框架是研究序贯决策问题策略的最常见平台。近来,公平性概念在机器学习界备受关注。人们可施加公平性条件:在任何时刻,即便在学习阶段,表现差的候选也不应被优先于表现好的候选。该公平性约束被认为是最严格的约束之一,并已在平稳设置下的随机多臂老虎机框架中被研究,且已建立后悔界。本文主要目标是在非平稳设置中研究此问题。我们提出一种称为带探索的公平上置信界(Fair-UCBe)的新算法,用于求解缓慢变化的随机 kk 臂老虎机问题。据此我们给出两个结果:(i)Fair-UCBe 确实满足上述公平性条件;(ii)对某个合适的 α(0,1)\alpha \in (0, 1),它达到 O(k32T1α2logT)O\left(k^{\frac{3}{2}} T^{1 - \frac{\alpha}{2}} \sqrt{\log T}\right) 的后悔界,其中 TT 为时间范围。据我们所知,这是首个适用于非平稳老虎机且具有次线性后悔界的公平算法。我们展示了当环境变化趋于零时,我们的算法在非平稳情形下的性能趋近于其平稳对应情形。

关键词

引用

@article{arxiv.2012.13380,
  title  = {A Regret bound for Non-stationary Multi-Armed Bandits with Fairness Constraints},
  author = {Shaarad A. R and Ambedkar Dukkipati},
  journal= {arXiv preprint arXiv:2012.13380},
  year   = {2020}
}