中文

面向群体敏感离线情境式多臂老虎机

机器学习 2026-01-07 v2

摘要

离线情境式多臂老虎机允许无需在线交互即可从历史/离线数据中学习策略。然而,最大化总体预期奖励的离线策略优化可能会无意中放大跨群体的奖励差异,导致某些群体从所学策略中受益更多,这引发公平性问题,尤其当资源有限时。本文研究了离线情境式多臂老虎机中的群体敏感公平性约束,减少策略学习期间可能出现的群体奖励差异。我们针对以下常见需求情况进行了研究:奖励差异受限于用户定义的阈值,或应在策略优化期间最小化奖励差异。我们通过在离线策略优化框架中引入群体奖励差异约束,提出了一种基于离线策略梯度优化方法的受控离线策略优化框架。为改进训练期间对群体奖励差异的估计,我们采用双鲁棒估计器,并进一步提供策略优化的收敛保证。在合成数据和真实数据集上的实证结果表明,我们的方法有效地减少了奖励差异,同时保持了具竞争力的总体性能。

关键词

引用

@article{arxiv.2510.27123,
  title  = {Group-Sensitive Offline Contextual Bandits},
  author = {Yihong Guo and Junjie Luo and Guodong Gao and Ritu Agarwal and Anqi Liu},
  journal= {arXiv preprint arXiv:2510.27123},
  year   = {2026}
}