中文

具有偏倚反馈的线性_bandit中的不公平代价

统计理论 2022-06-06 v2 机器学习 统计理论

摘要

本文研究具有偏倚线性 bandit 反馈的公平序贯决策问题。每轮中,玩家选择一个由协变量和敏感属性描述的动作。感知奖励为所选动作协变量的线性组合,但玩家仅观察到依赖于敏感属性的该奖励的偏倚评估。为刻画该问题的难度,我们设计了一种校正不公平评估的分阶段消除算法,并建立其 regret 的上界。我们证明最坏情况 regret 小于 O(κ1/3log(T)1/3T2/3)\mathcal{O}(\kappa_*^{1/3}\log(T)^{1/3}T^{2/3}),其中 κ\kappa_* 为刻画偏倚估计难度的显式几何常数。我们对某些动作集证明最坏情况 regret 的下界,表明该速率直至可能的亚对数因子是紧的。我们还导出依赖于间隔(gap)的 regret 上界,以及某些问题实例的匹配下界。有趣的是,这些结果揭示了一个 regime 转换:问题在其无偏对应问题一样困难的 regime,与可能困难得多的 regime 之间。

关键词

引用

@article{arxiv.2203.09784,
  title  = {The price of unfairness in linear bandits with biased feedback},
  author = {Solenne Gaucher and Alexandra Carpentier and Christophe Giraud},
  journal= {arXiv preprint arXiv:2203.09784},
  year   = {2022}
}