面向大动作空间离屏策略评估的双重稳健估计量
机器学习
2023-12-15 v3 人工智能
信息检索
机器学习
摘要
我们研究具有大动作空间的上下文赌博机设置下的离屏策略评估(OPE)。基准估计量面临严重的偏差与方差权衡。参数化方法因难以指定正确模型而存在偏差,而基于重要性权重的估计量则存在方差。为克服这些局限,边际化逆倾向得分(MIPS)被提出以通过动作嵌入来缓解估计量方差。然而,MIPS 在无直接效应假设下无偏,该假设要求动作嵌入完全中介动作对奖励的影响。为克服对这些不现实假设的依赖,我们提出边际化双重稳健(MDR)估计量。理论分析表明,所提估计量在比 MIPS 更弱的假设下无偏,同时相较 MIPS 降低了方差。实证实验验证了 MDR 相对于现有大动作空间估计量的优越性。
引用
@article{arxiv.2308.03443,
title = {Doubly Robust Estimator for Off-Policy Evaluation with Large Action Spaces},
author = {Tatsuhiro Shimizu and Laura Forastiere},
journal= {arXiv preprint arXiv:2308.03443},
year = {2023}
}
备注
14 pages, 8 figures