中文

基于预训练语言模型的百度搜索排序

信息检索 2021-06-28 v3

摘要

作为搜索引擎的核心,排序系统在满足用户信息需求方面起着关键作用。近来,基于预训练语言模型(PLMs)微调的神经排序器确立了最先进的排序效果。然而,由于以下挑战性问题,直接将这些基于 PLM 的排序器应用于大规模网页搜索系统并非易事:(1)海量神经 PLM 尤其是针对网页文档长文本极其昂贵的计算代价,阻碍了它们在要求极低延迟的在线排序系统中的部署;(2)现有与排序无关的预训练目标与要求全面相关性建模的即席检索场景之间的差距,是提升在线排序系统的另一主要障碍;(3)真实搜索引擎通常包含一组排序组件,因此单独微调的排序模型的兼容性对于协同排序系统至关重要。在这项工作中,我们贡献了一系列在部署最先进的中文预训练语言模型即 ERNIE 到在线搜索引擎系统中时,成功应用于解决上述问题的技术。我们首先阐明一种新颖实践,以低成本却强大的 Pyramid-ERNIE 架构来经济高效地摘要网页文档,并将所得摘要内容与查询进行上下文化。然后我们赋予一种创新范式,精细利用大规模有噪声且有偏的点击后行为数据来进行面向相关性的预训练。我们还提出了一种为在线排序系统定制的人锚定微调策略,旨在稳定各在线组件间的排序信号。大量离线与在线实验结果表明,所提技术显著提升了搜索引擎的性能。

关键词

引用

@article{arxiv.2105.11108,
  title  = {Pre-trained Language Model based Ranking in Baidu Search},
  author = {Lixin Zou and Shengqiang Zhang and Hengyi Cai and Dehong Ma and Suqi Cheng and Daiting Shi and Zhifan Zhu and Weiyue Su and Shuaiqiang Wang and Zhicong Cheng and Dawei Yin},
  journal= {arXiv preprint arXiv:2105.11108},
  year   = {2021}
}

备注

9-pages, 3 figures, 7 tables, SIGKDD 2021 accepted paper