上下文多臂老虎机的样本高效非平稳策略评估
机器学习
2012-10-19 v1 机器学习
摘要
我们提出并证明了一种用于探索学习设置的新离线策略评估器的性质,该评估器优于先前的评估器。特别是,它同时且正确地结合了来自重要性加权、双重稳健评估和非平稳策略评估方法的技术。此外,我们的方法通过仔细控制偏差 - 方差权衡允许生成更长的历史,并通过结合关于目标策略随机性的信息进一步降低方差。来自合成和现实世界探索学习问题的实证证据表明,新评估器成功统一了先前的方法,并以高出一个数量级的效率利用信息。
引用
@article{arxiv.1210.4862,
title = {Sample-efficient Nonstationary Policy Evaluation for Contextual Bandits},
author = {Miroslav Dudik and Dumitru Erhan and John Langford and Lihong Li},
journal= {arXiv preprint arXiv:1210.4862},
year = {2012}
}
备注
Appears in Proceedings of the Twenty-Eighth Conference on Uncertainty in Artificial Intelligence (UAI2012)