信息检索中的预训练方法
信息检索
2022-04-26 v3
摘要
信息检索(IR)的核心是从大规模资源中识别相关信息,并以排序列表的形式返回以响应用户的信息需求。近年来,深度学习的复兴极大地推动了该领域的发展,并催生了一个名为 NeuIR(即神经信息检索)的热点话题,尤其是预训练方法(PTMs)这一范式。得益于精巧的预训练目标和巨大的模型规模,预训练模型能够从海量文本数据中学习通用语言表示,这有益于 IR 的排序任务。近期,大量致力于将 PTMs 应用于 IR 的工作被提出以提升检索性能。考虑到该方向的快速进展,本综述旨在对 IR 中的预训练方法进行系统梳理。具体而言,我们概述了应用于 IR 系统不同组件的 PTMs,包括检索组件、重排序组件以及其他组件。此外,我们还介绍了专为 IR 设计的 PTMs,并总结了可用数据集及基准排行榜。而且,我们讨论了若干开放挑战并强调几个有前景的方向,期望能启发和促进未来更多相关主题的研究工作。
引用
@article{arxiv.2111.13853,
title = {Pre-training Methods in Information Retrieval},
author = {Yixing Fan and Xiaohui Xie and Yinqiong Cai and Jia Chen and Xinyu Ma and Xiangsheng Li and Ruqing Zhang and Jiafeng Guo},
journal= {arXiv preprint arXiv:2111.13853},
year = {2022}
}