中文

上下文赌博机中一般协变量偏移下的分布鲁棒策略评估

机器学习 2024-08-12 v2

摘要

我们引入了一种分布鲁棒方法,以提高一般协变量偏移下上下文赌博机中离线策略评估的可靠性。我们的方法旨在当记录数据和目标数据之间的上下文及策略分布存在差异时,提供鲁棒的策略评估结果。我们方法论的核心是应用鲁棒回归,这是一种在此处经过调整以改进基于记录数据的条件奖励分布估计的分布鲁棒技术。利用从鲁棒回归获得的奖励模型,我们通过将我们的奖励模型整合到既有的评估框架(即直接方法和双重鲁棒方法)中,开发了一套全面的策略价值估计量。通过理论分析,我们进一步证明所提出的策略价值估计量为偏差提供了有限样本上界,相较于传统方法具有明显优势,尤其是在偏移较大时。最后,我们设计了广泛的策略评估场景,涵盖了不同幅度的偏移以及一系列记录策略和目标策略。我们的实证结果表明,我们的方法显著优于基线方法,特别是在仅有策略偏移的设置下 90% 的情形中,以及在一般协变量偏移设置下 72% 的情形中表现尤为突出。

关键词

引用

@article{arxiv.2401.11353,
  title  = {Distributionally Robust Policy Evaluation under General Covariate Shift in Contextual Bandits},
  author = {Yihong Guo and Hao Liu and Yisong Yue and Anqi Liu},
  journal= {arXiv preprint arXiv:2401.11353},
  year   = {2024}
}