反事实学习方法的大规模验证:一个测试平台
机器学习
2017-06-27 v2 人工智能
机器学习
摘要
执行有效的离策略学习(off-policy learning)的能力将彻底改变构建更好的交互系统的过程,例如用于电子商务、计算广告和新闻的搜索引擎和推荐系统。近期针对离策略评估与学习的方法在这些场景下显得很有前景。在本文中,我们提供真实世界的数据和一个标准化测试平台,利用展示广告数据来系统地研究这些算法。具体而言,我们考虑用用户可能想要购买的多个产品的集合来填充横幅广告的问题。本文介绍了我们的测试平台、为确保其有效性而运行的合理性检查,并展示了比较最先进离策略学习方法(如双重稳健优化、POEM,以及使用回归基线约化为监督学习的方法)的结果。我们的结果提供了实验证据,表明近期的离策略学习方法在大规模真实世界数据集上能够超越最先进的监督学习技术。
引用
@article{arxiv.1612.00367,
title = {Large-scale Validation of Counterfactual Learning Methods: A Test-Bed},
author = {Damien Lefortier and Adith Swaminathan and Xiaotao Gu and Thorsten Joachims and Maarten de Rijke},
journal= {arXiv preprint arXiv:1612.00367},
year = {2017}
}
备注
10 pages, What If workshop NIPS 2016