中文

面向Top-k排序的策略感知无偏学习排序

信息检索 2021-04-12 v2

摘要

反事实学习排序(LTR)方法利用包含交互偏差的日志用户交互来优化排序系统。现有方法仅当用户在每次排序中都看到所有相关物品时才无偏。目前尚无针对top-k排序的反事实无偏LTR方法。我们引入了一种新颖的针对LTR指标的、能够考虑随机日志策略影响的策略感知反事实估计器。我们证明了若每个相关物品在top-k排序中出现的概率非零,则该策略感知估计器是无偏的。实验结果表明,我们估计器的性能不受k大小的影响:对于任意k,策略感知估计器在从top-k反馈中学习时能达到与从完整排序反馈中学习相同的检索性能。最后,我们引入了传统LTR方法的新扩展,以执行反事实LTR并优化top-k指标。综上,我们的贡献提出了首个从top-k反馈学习并优化top-k指标的策略感知无偏LTR方法。因此,反事实LTR现在可应用于搜索与推荐中非常普遍的top-k排序场景。

关键词

引用

@article{arxiv.2005.09035,
  title  = {Policy-Aware Unbiased Learning to Rank for Top-k Rankings},
  author = {Harrie Oosterhuis and Maarten de Rijke},
  journal= {arXiv preprint arXiv:2005.09035},
  year   = {2021}
}

备注

SIGIR 2020 full conference paper