基于强化学习的去偏搜索点击行为建模
信息检索
2021-05-24 v1
摘要
用户对 Web 搜索结果的点击是评估和提升网络搜索质量的关键信号之一,并已被广泛用作当前最先进的学习排序(LTR)模型的组成部分。随着主流搜索引擎可获取大量搜索日志,有效的搜索者点击行为模型已经出现,用于评估和训练 LTR 模型。然而,在对用户点击行为建模时,考虑该行为的偏差至关重要。特别地,当搜索结果未被点击时,用户未必是认为其不相关而未选,而可能仅仅是未注意到,尤其是对于排名较低的结果。点击日志数据中的此类偏差可被纳入点击模型,从而将误差传播至最终的 LTR 排序模型或评估指标。在本文中,我们提出去偏强化学习点击模型(DRLC)。DRLC 模型放宽了先前关于用户浏览行为及相应潜在状态的假设。为实现 DRLC 模型,使用卷积神经网络作为强化学习的价值网络,训练以学习减少点击日志中偏差的策略。为证明 DRLC 模型的有效性,我们首先使用已建立的点击预测指标(包括对数似然和困惑度)与先前最先进方法比较性能。我们进一步展示 DRLC 也带来了排序性能的提升。我们的实验证明了 DRLC 模型在学习减少点击日志偏差方面的有效性,从而改进了建模性能,并显示出将 DRLC 用于提升 Web 搜索质量的潜力。
引用
@article{arxiv.2105.10072,
title = {De-Biased Modelling of Search Click Behavior with Reinforcement Learning},
author = {Jianghong Zhou and Sayyed M. Zahiri and Simon Hughes and Khalifeh Al Jadda and Surya Kallumadi and Eugene Agichtein},
journal= {arXiv preprint arXiv:2105.10072},
year = {2021}
}
备注
SIGIR 2021 Short Paper