中文

面向稠密段落检索的无监督语料感知语言模型预训练

信息检索 2021-08-13 v1 计算与语言

摘要

近期研究证明了使用微调语言模型(LM)进行稠密检索的有效性。然而,稠密检索器难以训练,通常需重度工程化的微调流程才能发挥其全部潜力。在本文中,我们识别并解决了稠密检索器的两个潜在问题:i)对训练数据噪声的脆弱性,以及 ii)需要大批次以稳健地学习嵌入空间。我们使用近期提出的 Condenser 预训练架构,其通过 LM 预训练学习将信息压缩进稠密向量。在此基础上,我们提出 coCondenser,它增加了一个无监督的语料级对比损失来预热段落嵌入空间。在 MS-MARCO、Natural Question 和 Trivia QA 数据集上的检索实验表明,coCondenser 消除了对增强、合成或过滤等重度数据工程的需求,也消除了对大批次训练的需求。它在使用简单小批次微调的情况下,表现出与最先进、重度工程化的系统 RocketQA 相当的性能。

关键词

引用

@article{arxiv.2108.05540,
  title  = {Unsupervised Corpus Aware Language Model Pre-training for Dense Passage Retrieval},
  author = {Luyu Gao and Jamie Callan},
  journal= {arXiv preprint arXiv:2108.05540},
  year   = {2021}
}