中文

具有凹回报的情境多臂老虎机及其在公平排序中的应用

机器学习 2023-03-01 v2 人工智能 计算机与社会 信息检索 机器学习

摘要

我们考虑具有凹回报的情境多臂老虎机(CBCR),这是一个多目标老虎机问题,其中回报之间所需的权衡由已知的凹目标函数定义,且回报向量依赖于观测到的随机上下文。我们提出了首个在无策略空间限制下具有可证明消失后悔值的 CBCR 算法,而先前的工作仅限于有限策略空间或表格表示。我们的方案基于对 CBCR 算法的几何解释,将其视为在所有随机策略所张成的期望回报凸集上的优化算法。基于约束凸优化中的 Frank-Wolfe 分析,我们推导出一种将 CBCR 后悔值归约为标量回报老虎机问题后悔值的新方法。我们说明了如何直接应用该归约,在非组合动作情形下获得适用于线性和一般回报函数的 CBCR 算法。受推荐系统中公平性的驱动,我们描述了具有排序和公平性感知目标的 CBCR 特例,从而得到了首个针对具有曝光公平性的情境组合老虎机提供后悔值保证的算法。

关键词

引用

@article{arxiv.2210.09957,
  title  = {Contextual bandits with concave rewards, and an application to fair ranking},
  author = {Virginie Do and Elvis Dohmatob and Matteo Pirotta and Alessandro Lazaric and Nicolas Usunier},
  journal= {arXiv preprint arXiv:2210.09957},
  year   = {2023}
}

备注

ICLR 2023