反事实学习排序的加速收敛
机器学习
2020-05-22 v1 信息检索
机器学习
摘要
反事实学习排序(Learning to Rank, LTR)算法从记录的用户交互中学习排序模型,这些交互通常由生产系统收集。与在线学习方法相比,采用这种离线学习方法有许多好处,但它具有挑战性,因为用户反馈往往包含高水平的偏差。无偏 LTR 使用逆倾向评分(Inverse Propensity Scoring, IPS)来从记录的用户交互中实现无偏学习。将随机梯度下降(Stochastic Gradient Descent, SGD)方法应用于反事实学习问题的主要困难之一是由倾向权重引入的大方差。在本文中,我们表明带有 IPS 加权梯度的 SGD 方法的收敛速率受到 IPS 权重引入的大方差的影响:收敛缓慢,尤其是在存在大 IPS 权重时。为克服这一限制,我们提出了一种称为 CounterSample 的新型学习算法,该算法在理论上具有比标准 IPS 加权梯度下降方法更好的收敛性。我们证明了 CounterSample 收敛更快,并通过在多种有偏 LTR 场景中进行大量实验——跨优化器、批大小和不同程度的位置偏差——来补充我们的理论发现。
引用
@article{arxiv.2005.10615,
title = {Accelerated Convergence for Counterfactual Learning to Rank},
author = {Rolf Jagerman and Maarten de Rijke},
journal= {arXiv preprint arXiv:2005.10615},
year = {2020}
}
备注
SIGIR 2020 full conference paper