双重鲁棒策略评估与学习
机器学习
2011-05-09 v2 人工智能
机器人学
应用统计
机器学习
摘要
我们研究在仅部分观测到奖励,但可以将其建模为动作与观测上下文函数的环境中的决策制定。这种被称为上下文强盗的设定涵盖了广泛的应用,包括医疗保健政策和互联网广告。一个核心任务是根据由上下文、动作和已获奖励组成的历史数据来评估新策略。关键挑战在于,过去的数据通常不能真实反映新策略所采取动作的比例。以往的方法要么依赖于奖励模型,要么依赖于过去策略的模型。前者受到大偏差的困扰,而后者则具有大方差。在这项工作中,我们通过将双重鲁棒技术应用于策略评估和优化问题,利用了这两种方法的优势并克服了它们的弱点。我们证明,当我们拥有一个良好的(但不一定一致的)奖励模型或一个良好的(但不一定一致的)过去策略模型时,该方法能产生准确的值估计。广泛的实证比较表明,双重鲁棒方法一致地改进了现有技术,在值估计中实现了更低的方差,并产生了更好的策略。因此,我们期望双重鲁棒方法成为常规实践。
引用
@article{arxiv.1103.4601,
title = {Doubly Robust Policy Evaluation and Learning},
author = {Miroslav Dudik and John Langford and Lihong Li},
journal= {arXiv preprint arXiv:1103.4601},
year = {2011}
}
备注
Published at ICML 2011, 8 pages, 6 figures