中文

反事实学习排序的通用框架

信息检索 2019-08-28 v3 机器学习

摘要

隐式反馈(如点击、停留时间)是学习排序(Learning-to-Rank)极具吸引力的训练数据来源,但其朴素使用会导致受展示偏差扭曲的学习结果。然而,对于优化线性排序函数平均排名这一特殊情况,近期提出的SVM-PropRank方法已表明反事实推断技术可被用于可证明地克服展示偏差的扭曲效应。超越这一特殊情况,本文提供了一个通用且理论严谨的反事实学习排序框架,能够对广泛的加性排序度量(如折损累计增益(DCG))以及广泛的模型(如深度网络)进行无偏训练。具体而言,我们推导了倾向加权基于排名的度量的松弛形式,该松弛是可次微分的,因而适用于基于梯度的优化。我们通过实例化两种新的学习方法来证明该通用方法的有效性。其一是一种优化DCG的新型无偏SVM——称为SVM PropDCG——,并展示了所得优化问题如何通过凸凹过程(CCP)求解。其二是Deep PropDCG,其中排序函数可以是任意深度网络。除理论支撑外,我们经实证发现SVM PropDCG在DCG方面显著优于现有线性排序器。此外,通过Deep PropDCG训练非线性排序函数的能力进一步提升了性能。

关键词

引用

@article{arxiv.1805.00065,
  title  = {A General Framework for Counterfactual Learning-to-Rank},
  author = {Aman Agarwal and Kenta Takatsu and Ivan Zaitsev and Thorsten Joachims},
  journal= {arXiv preprint arXiv:1805.00065},
  year   = {2019}
}