上下文赌博机离线策略评估中的边际密度比
机器学习
2023-12-05 v1 机器学习
统计方法学
摘要
上下文赌博机中的离线策略评估对于利用现有数据评估新策略而无需进行昂贵的实验至关重要。然而,当前的 OPE 方法,如逆概率加权(IPW)和双重稳健(DR)估计器,存在高方差问题,特别是在目标策略与行为策略之间重叠度低,或动作与上下文空间较大的情况下。在本文中,我们为上下文赌博机引入了一种新的 OPE 估计器——边际比(MR)估计器,它关注结果 的边际分布的偏移,而非策略本身的偏移。通过严格的理论分析,我们证明了 MR 估计器在方差缩减方面相较于 IPW 和 DR 等传统方法的优势。此外,我们建立了 MR 估计器与最先进的边际化逆倾向得分(MIPS)估计器之间的联系,证明在广义的 MIPS 估计器族中 MR 能实现更低的方差。我们进一步阐明了 MR 估计器在因果推断环境中的效用,它在估计平均处理效应(ATE)时展现出增强的性能。我们在合成数据集和真实世界数据集上的实验证实了我们的理论发现,并突出了 MR 估计器在上下文赌博机 OPE 中的实际优势。
引用
@article{arxiv.2312.01457,
title = {Marginal Density Ratio for Off-Policy Evaluation in Contextual Bandits},
author = {Muhammad Faaiz Taufiq and Arnaud Doucet and Rob Cornish and Jean-Francois Ton},
journal= {arXiv preprint arXiv:2312.01457},
year = {2023}
}
备注
Conference on Neural Information Processing Systems (NeurIPS 2023)