中文

带背包情境多臂老虎机中的小总成本约束及其在公平性中的应用

机器学习 2023-10-27 v2 机器学习

摘要

我们考虑带背包的情境多臂老虎机[CBwK]问题,该问题中每一轮获得一个标量奖励并承受向量值成本。学习者的目标是最大化累积奖励,同时确保累积成本低于某些预定的成本约束。我们假设上下文来自连续集合,成本可正可负,且期望奖励与成本函数虽未知但可被一致估计——这是文献中的典型假设。在此设定下,总成本约束此前至少须为 T3/4T^{3/4} 量级(其中 TT 为轮数),甚至通常假设与 TT 线性相关。然而,我们的动机是使用 CBwK 来施加组间均等平均成本的公平性约束:相应成本约束关联的预算应尽可能接近自然偏差,即 T\sqrt{T} 量级。为此,我们引入一种基于投影梯度下降更新的对偶策略,能够处理低至 T\sqrt{T} 量级(相差多对数项)的总成本约束。该策略比文献中现有策略更直接且更简单。它依赖于对步长的细致自适应调参。

关键词

引用

@article{arxiv.2305.15807,
  title  = {Small Total-Cost Constraints in Contextual Bandits with Knapsacks, with Application to Fairness},
  author = {Evgenii Chzhen and Christophe Giraud and Zhen Li and Gilles Stoltz},
  journal= {arXiv preprint arXiv:2305.15807},
  year   = {2023}
}