中文

基于合取效应建模的大动作空间离屏策略评估

机器学习 2023-06-12 v2 人工智能 机器学习

摘要

我们研究大离散动作空间下上下文赌博机(contextual bandit)策略的离屏策略评估(OPE),其中传统的逆概率加权方法受限于过大的方差。为规避该方差问题,我们提出一种称为 OffCEM 的新估计量,它基于合取效应模型(CEM),即将因果效应分解为簇效应和残差效应的一种新颖分解。OffCEM 仅对动作簇施加逆概率加权,并通过基于模型的奖励估计处理残差因果效应。我们证明所提估计量在称为局部正确性的新条件下是无偏的,该条件仅要求残差效应模型保持每个簇内动作的相对期望奖励差异。为最好地利用 CEM 和局部正确性,我们还提出一种用于基于模型估计的新两步过程,第一步最小化偏差、第二步最小化方差。我们发现所得的 OffCEM 估计量相比一系列常规估计量在偏差和方差上均有实质性改善。实验表明,尤其在存在大量动作时,OffCEM 在 OPE 中提供了实质性改进。

关键词

引用

@article{arxiv.2305.08062,
  title  = {Off-Policy Evaluation for Large Action Spaces via Conjunct Effect Modeling},
  author = {Yuta Saito and Qingyang Ren and Thorsten Joachims},
  journal= {arXiv preprint arXiv:2305.08062},
  year   = {2023}
}

备注

accepted at ICML2023. arXiv admin note: text overlap with arXiv:2202.06317