无偏学习排序:在线还是离线?
信息检索
2020-12-03 v3 机器学习
摘要
如何通过利用有偏用户反馈进行学习排序来获得无偏排序模型,是信息检索(IR)中的一个重要研究问题。现有的无偏学习排序(ULTR)研究可大致分为两类——基于日志数据研究无偏学习算法的所谓\textit{离线}无偏学习,以及基于实时用户交互研究无偏参数估计的所谓\textit{在线}学习排序。尽管它们对\textit{无偏性}的定义不同,这两类 ULTR 算法有着相同的目标——寻找基于文档内在相关性或效用进行排序的最佳模型。然而,大多数关于离线和在线无偏学习排序的研究是并行开展的,未对其背景理论与经验性能进行详细比较。在本文中,我们形式化了无偏学习排序任务,并表明现有的离线无偏学习与在线学习排序算法只是同一枚硬币的两面。我们评估了六种最先进的 ULTR 算法,发现它们大多只需少量或不需修改即可用于离线与在线环境。进一步地,我们分析了不同的离线与在线学习范式将如何影响各算法在合成与真实搜索数据上的理论基础与经验效果。我们的发现可为在实践中选择与部署 ULTR 算法提供重要见解与指导。
引用
@article{arxiv.2004.13574,
title = {Unbiased Learning to Rank: Online or Offline?},
author = {Qingyao Ai and Tao Yang and Huazheng Wang and Jiaxin Mao},
journal= {arXiv preprint arXiv:2004.13574},
year = {2020}
}