中文

可微分无偏在线排序学习

信息检索 2018-09-25 v1

摘要

在线排序学习(OLTR)方法基于用户交互优化排序器。最先进的OLTR方法专为线性模型构建,其方法不能很好地扩展到神经网络等非线性模型。我们引入一种全新的OLTR方法,在每次交互后构造加权可微分成对损失:成对可微分梯度下降(PDGD)。PDGD摆脱了依赖交织或多重交织以及大量模型采样来估计梯度的传统方法,其梯度基于从用户点击推断文档对之间的偏好,可优化任意可微分模型。我们证明PDGD的梯度相对于用户文档对偏好是无偏的。我们在最大的公开可用排序学习(LTR)数据集上的实验表明,在所有交互噪声水平下均有显著且明显的改进。PDGD在学习的以及最终收敛速度方面均优于现有OLTR方法。此外,与以往OLTR方法不同,PDGD还允许有效优化非线性模型。我们的结果显示,使用神经网络在收敛时比线性模型获得更好的性能。总之,PDGD是一种高效且无偏的OLTR方法,可提供比以往更好的用户体验。

关键词

引用

@article{arxiv.1809.08415,
  title  = {Differentiable Unbiased Online Learning to Rank},
  author = {Harrie Oosterhuis and Maarten de Rijke},
  journal= {arXiv preprint arXiv:1809.08415},
  year   = {2018}
}

备注

Conference on Information and Knowledge Management 2018