具有偏倚反馈的线性_bandit中的不公平代价
统计理论
2022-06-06 v2 机器学习
统计理论
摘要
本文研究具有偏倚线性 bandit 反馈的公平序贯决策问题。每轮中,玩家选择一个由协变量和敏感属性描述的动作。感知奖励为所选动作协变量的线性组合,但玩家仅观察到依赖于敏感属性的该奖励的偏倚评估。为刻画该问题的难度,我们设计了一种校正不公平评估的分阶段消除算法,并建立其 regret 的上界。我们证明最坏情况 regret 小于 ,其中 为刻画偏倚估计难度的显式几何常数。我们对某些动作集证明最坏情况 regret 的下界,表明该速率直至可能的亚对数因子是紧的。我们还导出依赖于间隔(gap)的 regret 上界,以及某些问题实例的匹配下界。有趣的是,这些结果揭示了一个 regime 转换:问题在其无偏对应问题一样困难的 regime,与可能困难得多的 regime 之间。
引用
@article{arxiv.2203.09784,
title = {The price of unfairness in linear bandits with biased feedback},
author = {Solenne Gaucher and Alexandra Carpentier and Christophe Giraud},
journal= {arXiv preprint arXiv:2203.09784},
year = {2022}
}