中文

一种简洁而有效的主动排序学习框架

信息检索 2024-04-01 v2

摘要

中国已成为拥有约10亿互联网用户的全球最大在线市场,百度运营着全球最大的中文搜索引擎,服务数亿日活跃用户,每日响应数十亿次查询。为处理网页规模下用户的多样化查询请求,百度在理解用户查询、从万亿级网页池中检索相关内容、并将最相关网页排在结果顶部方面做出了巨大努力。在百度搜索使用的这些组件中,排序学习(LTR)起着关键作用,我们需要及时标注极其大量的查询及相关网页,以训练和更新在线LTR模型。为降低查询/网页标注的成本与时间消耗,我们在本工作中研究主动排序学习(active LTR)问题,即筛选未标注查询用于标注与训练。具体而言,我们首先考察了准则——排序熵(RE),它利用基于委员会查询(QBC)方法,刻画由不同检查点更新的系列在线LTR模型对某一查询下相关网页产生的熵。随后,我们探索了一种新准则,即预测方差(PV),衡量某查询下所有相关网页预测结果的方差。我们的实证研究发现,RE可能偏好从池中选取低频查询进行标注,而PV更倾向于优先高频查询。最后,我们将这两个互补准则结合作为主动学习的样本选择策略。与基线算法的广泛对比实验表明,所提方法能以相同的标注预算训练出达成更高折损累计增益(即相对提升ΔDCG4=1.38%)的LTR模型。

关键词

引用

@article{arxiv.2205.10137,
  title  = {A Simple yet Effective Framework for Active Learning to Rank},
  author = {Qingzhong Wang and Haifang Li and Haoyi Xiong and Wen Wang and Jiang Bian and Yu Lu and Shuaiqiang Wang and Zhicong Cheng and Dejing Dou and Dawei Yin},
  journal= {arXiv preprint arXiv:2205.10137},
  year   = {2024}
}

备注

This paper is accepted to Machine Intelligence Research and a short version is presented in NeurIPS 2022 Workshop on Human in the Loop Learning