双重稳健策略评估与优化
统计方法学
2015-03-11 v1 人工智能
摘要
我们研究序贯决策环境,其中奖励仅被部分观测,但可建模为观测到的上下文和决策者所选动作的函数。这一被称为contextual bandits(情境多臂老虎机)的设置涵盖了广泛的应用,如医疗、内容推荐和互联网广告。一个核心任务是在给定由上下文、动作和接收到的奖励组成的历史数据下评估新策略。关键挑战在于过去的数据通常不能忠实代表新策略所采取动作的比例。先前的方法要么依赖于奖励模型,要么依赖于过去策略的模型。前者受困于大偏差,而后者具有大方差。在本工作中,我们通过将双重稳健(doubly robust)估计技术应用于策略评估与优化问题,利用两种方法的优势并克服其弱点。我们证明,当我们有良好的(但不必一致的)奖励模型或良好的(但不必一致的)过去策略模型时,该方法能产生准确的价值估计。广泛的实证比较表明,双重稳健估计全面优于现有技术,实现了更低的价值估计方差和更好的策略。因此,我们期望双重稳健方法成为策略评估与优化中的常见实践。
引用
@article{arxiv.1503.02834,
title = {Doubly Robust Policy Evaluation and Optimization},
author = {Miroslav Dudík and Dumitru Erhan and John Langford and Lihong Li},
journal= {arXiv preprint arXiv:1503.02834},
year = {2015}
}
备注
Published in at http://dx.doi.org/10.1214/14-STS500 the Statistical Science (http://www.imstat.org/sts/) by the Institute of Mathematical Statistics (http://www.imstat.org)