中文

利用 BERT 进行信息检索:综述、应用、资源与挑战

信息检索 2024-03-05 v1 人工智能 计算与语言

摘要

近年来,使用深度学习解决各种自然语言处理(NLP)问题的情况大幅增加。早期的深度学习模型受限于其顺序性或单向性,难以捕捉文本输入之间的上下文关系。来自 Transformer 的双向编码器表示(BERT)的引入为 Transformer 模型带来了强大的编码器,能够理解更广泛的上下文,并在各种 NLP 任务中提供最先进的性能。这激发了研究人员和从业者将 BERT 应用于实际问题,如信息检索(IR)。因此,专注于全面分析将 BERT 等预训练 Transformer 编码器应用于 IR 的流行方法的综述,对学术界和工业界都有用处。鉴于此,我们在本综述中回顾了各种基于 BERT 的方法,涵盖了广泛的 IR 技术,并将它们分为六个高层类别:(i) 处理长文档,(ii) 整合语义信息,(iii) 平衡有效性和效率,(iv) 预测术语权重,(v) 查询扩展,以及 (vi) 文档扩展。我们还提供了包括数据集和工具包在内的资源链接,用于基于 BERT 的 IR 系统。我们综述的一个关键亮点是比较了基于 BERT 的编码器模型与最新的生成式大语言模型(LLMs),如依赖解码器的 ChatGPT。尽管 LLMs 很流行,但我们发现对于特定任务,经过微调的 BERT 编码器仍然表现更优,且部署成本更低。最后,我们总结了综述的全面成果,并提出了该领域未来研究的方向。

关键词

引用

@article{arxiv.2403.00784,
  title  = {Utilizing BERT for Information Retrieval: Survey, Applications, Resources, and Challenges},
  author = {Jiajia Wang and Jimmy X. Huang and Xinhui Tu and Junmei Wang and Angela J. Huang and Md Tahmid Rahman Laskar and Amran Bhuiyan},
  journal= {arXiv preprint arXiv:2403.00784},
  year   = {2024}
}