中文

基于无偏奖励塑形的强化在线学习排序

信息检索 2022-01-06 v1

摘要

在线学习排序(OLTR)旨在直接从用户交互(如点击)衍生的隐式反馈中学习排序器。然而,点击是一种有偏信号:具体而言,排名靠前的文档比排名靠后的文档更可能吸引更多点击(位置偏差)。本文中,我们提出一种用于 OLTR 的新型学习算法,该算法利用强化学习来优化排序器:强化在线学习排序(ROLTR)。在 ROLTR 中,排序器的梯度基于分配给被点击和未被点击文档的奖励来估计。为去除奖励信号中用户位置偏差,我们引入了无偏奖励塑形函数,利用逆倾向评分处理被点击与未被点击的文档。我们的方法还能对未被点击文档建模,这带来了进一步优势:有效训练排序器所需的用户交互更少,从而提升了效率。在标准 OLTR 数据集上的实证评估表明,ROLTR 达到了最先进的性能,并且比其他 OLTR 方法提供了显著更好的用户体验。为促进实验的可复现性,我们在 https://github.com/ielab/OLTR 公开了所有实验代码。

关键词

引用

@article{arxiv.2201.01534,
  title  = {Reinforcement Online Learning to Rank with Unbiased Reward Shaping},
  author = {Shengyao Zhuang and Zhihao Qiao and Guido Zuccon},
  journal= {arXiv preprint arXiv:2201.01534},
  year   = {2022}
}

备注

32 pages; Journal paper