Web 规模下基于过参数化的生成式预训练排序模型(扩展摘要)
信息检索
2024-09-26 v1 机器学习
摘要
学习排序(LTR)被广泛应用于 Web 搜索中,以根据输入查询从检索到的内容中优先呈现相关的网页。然而,传统的 LTR 模型遇到两个主要障碍,导致性能次优:(1) 缺乏具有涵盖各种搜索查询流行度的排序分数且标注良好的查询-网页对,这妨碍了它们处理整个流行度范围内查询的能力;(2) 训练不充分的模型无法为 LTR 诱导出泛化表示,从而导致过拟合。为了应对这些挑战,我们提出了一种生成式半监督预训练(GS2P)LTR 模型。我们在公开可用数据集和从大规模搜索引擎收集的真实数据集上进行了广泛的离线实验。此外,我们将 GS2P 部署在具有真实流量的大规模 Web 搜索引擎中,在真实应用中观察到了显著的改进。
引用
@article{arxiv.2409.16594,
title = {Generative Pre-trained Ranking Model with Over-parameterization at Web-Scale (Extended Abstract)},
author = {Yuchen Li and Haoyi Xiong and Linghe Kong and Jiang Bian and Shuaiqiang Wang and Guihai Chen and Dawei Yin},
journal= {arXiv preprint arXiv:2409.16594},
year = {2024}
}