中文

CorpusBrain:为知识密集型语言任务预训练生成式检索模型

计算与语言 2022-08-17 v1 信息检索

摘要

知识密集型语言任务(KILT)通常需要大量信息以提供正确答案。解决该问题的一种流行范式是将检索系统与机器阅读器相结合,前者检索支撑证据,后者检查证据以生成答案。近来,在阅读器组件方面,大规模预训练生成式模型带来了显著进展。同时,检索组件中的大多数现有方案依赖于传统的“索引-检索-然后排序”流程,其存在内存占用大和难以端到端优化的缺点。受近期构建基于模型的 IR(信息检索)模型工作的启发,我们提出用一种新颖的单步生成式模型替代传统的多步检索流程,该模型可大幅简化检索过程并以端到端方式优化。我们表明,可通过一组充分设计的预训练任务学习到强大的生成式检索模型,并可通过进一步微调将其用于改进多种下游 KILT 任务。我们将该预训练生成式检索模型命名为 CorpusBrain,因为语料库的所有信息均编码于其参数中,无需构建额外索引。实证结果表明,CorpusBrain 在 KILT 基准的检索任务上显著优于强基线,并确立了新的最先进下游性能。我们还展示了 CorpusBrain 在零资源与低资源设置下表现良好。

关键词

引用

@article{arxiv.2208.07652,
  title  = {CorpusBrain: Pre-train a Generative Retrieval Model for Knowledge-Intensive Language Tasks},
  author = {Jiangui Chen and Ruqing Zhang and Jiafeng Guo and Yiqun Liu and Yixing Fan and Xueqi Cheng},
  journal= {arXiv preprint arXiv:2208.07652},
  year   = {2022}
}

备注

Accepted by CIKM 2022