中文

面向大动作空间离屏策略评估的双重稳健估计量

机器学习 2023-12-15 v3 人工智能 信息检索 机器学习

摘要

我们研究具有大动作空间的上下文赌博机设置下的离屏策略评估(OPE)。基准估计量面临严重的偏差与方差权衡。参数化方法因难以指定正确模型而存在偏差,而基于重要性权重的估计量则存在方差。为克服这些局限,边际化逆倾向得分(MIPS)被提出以通过动作嵌入来缓解估计量方差。然而,MIPS 在无直接效应假设下无偏,该假设要求动作嵌入完全中介动作对奖励的影响。为克服对这些不现实假设的依赖,我们提出边际化双重稳健(MDR)估计量。理论分析表明,所提估计量在比 MIPS 更弱的假设下无偏,同时相较 MIPS 降低了方差。实证实验验证了 MDR 相对于现有大动作空间估计量的优越性。

关键词

引用

@article{arxiv.2308.03443,
  title  = {Doubly Robust Estimator for Off-Policy Evaluation with Large Action Spaces},
  author = {Tatsuhiro Shimizu and Laura Forastiere},
  journal= {arXiv preprint arXiv:2308.03443},
  year   = {2023}
}

备注

14 pages, 8 figures