统一在线与反事实学习排序
信息检索
2020-12-09 v1
摘要
基于用户交互优化排序系统是一个被充分研究的问题。基于用户交互优化排序系统的最先进方法分为在线方法——通过直接与用户交互来学习——和反事实方法——从历史事件交互中学习。现有在线方法在没有在线干预时受到阻碍,因此不应以反事实方式应用。反之,反事实方法无法直接受益于在线干预。我们提出了一种面向反事实与在线学习排序(LTR)的新型干预感知估计器。借助该干预感知估计器,我们旨在弥合在线/反事实LTR的分割,因其被证明在在线与反事实场景中均高度有效。该估计器利用基于日志策略行为与在线干预(在收集点击数据过程中对日志策略的更改)的修正,来校正位置偏差、信任偏差与条目选择偏差的影响。我们在半合成实验设置下进行的实验结果表明,与现有反事实LTR方法不同,干预感知估计器可极大受益于在线干预。
引用
@article{arxiv.2012.04426,
title = {Unifying Online and Counterfactual Learning to Rank},
author = {Harrie Oosterhuis and Maarten de Rijke},
journal= {arXiv preprint arXiv:2012.04426},
year = {2020}
}
备注
Harrie Oosterhuis and Maarten de Rijke. 2021. Unifying Online and Counterfactual Learning to Rank: A Novel Counterfactual Estimator that Effectively Utilizes Online Interventions. In The 14th ACM International Conference on Web Search and Data Mining (WSDM '21), March 8-12, 2021, Jerusalem, Israel. ACM, New York, NY, USA, 9 pages. https://doi.org/10.1145/3437963.3441794