反事实风险最小化:从记录的 Bandit 反馈中学习
机器学习
2015-05-22 v2 机器学习
摘要
我们提出了一种用于从记录的 bandit 反馈中进行批量学习的学习原理和高效算法。这种学习环境在在线系统中无处不在(例如广告放置、网页搜索、推荐),其中算法对给定输入(例如查询)进行预测(例如广告排序)并观察 bandit 反馈(例如用户对呈现广告的点击)。我们首先通过倾向评分解决学习问题的反事实性质。接下来,我们证明了对倾向加权经验风险估计器的方差进行考虑的泛化误差界。这些建设性界引出了反事实风险最小化(CRM)原理。我们展示 CRM 如何用于推导一种新的学习方法——称为指数模型策略优化器(Policy Optimizer for Exponential Models, POEM)——用于学习用于结构化输出预测的随机线性规则。我们提出了 POEM 目标的分解,从而实现高效的随机梯度优化。POEM 在多个多标签分类问题上进行了评估,显示出相比最先进(SOTA)方法大幅改进的鲁棒性和泛化性能。
引用
@article{arxiv.1502.02362,
title = {Counterfactual Risk Minimization: Learning from Logged Bandit Feedback},
author = {Adith Swaminathan and Thorsten Joachims},
journal= {arXiv preprint arXiv:1502.02362},
year = {2015}
}
备注
10 pages