从极端_bandit反馈中学习
机器学习
2021-02-24 v2 机器学习
摘要
我们研究在极大动作空间设定下从bandit反馈进行批量学习的问题。从极端bandit反馈学习在推荐系统中无处不在,其中每天在由数百万选择组成的集合上做出数十亿决策,产生海量观测数据。在这些大规模真实世界应用中,尽管由于bandit反馈与监督标签之间的不匹配引起显著偏差,诸如极端多标签分类(XMC)之类的监督学习框架仍被广泛使用。此类偏差可通过重要性采样技术减轻,但这些技术在应对大量动作时遭受不切实际的方差。在本文中,我们引入一种选择性重要性采样估计器(sIS),其在显著更有利的偏差-方差 regime下运作。sIS估计器通过对每个实例关于一小部分动作的奖励条件期望执行重要性采样获得(一种Rao-Blackwellization形式)。我们在一新颖算法流程——命名为极端模型策略优化(POXM)——中采用该估计器,用于从XMC任务上的bandit反馈学习。在POXM中,sIS估计器所选动作是日志记录策略的top-p动作,其中p从数据调整且显著小于动作空间大小。我们在三个XMC数据集上使用监督到bandit转换,将我们的POXM方法与三种竞争方法基准比较:BanditNet、先前应用的局部匹配剪枝策略、以及监督学习基线。尽管BanditNet有时相较日志记录策略边际改进,我们的实验显示POXM系统且显著地改进所有基线。
引用
@article{arxiv.2009.12947,
title = {Learning from eXtreme Bandit Feedback},
author = {Romain Lopez and Inderjit S. Dhillon and Michael I. Jordan},
journal= {arXiv preprint arXiv:2009.12947},
year = {2021}
}