CorpusBrain++:面向知识密集型语言任务的持续生成式预训练框架
信息检索
2024-02-27 v1 计算与语言
摘要
知识密集型语言任务(KILTs)通常需要从可信语料库(如 Wikipedia)中检索相关文档以生成特定答案。最近,一种名为 CorpusBrain 的面向 KILTs 的预训练生成式检索模型被提出,并达到了新的最先进(SOTA)检索性能。然而,大多数现有的 KILTs 研究(包括 CorpusBrain)主要关注静态文档集合,忽略了现实场景的动态特性,即新文档不断被纳入源语料库。为了填补这一空白,探索检索模型有效处理 KILTs 固有动态检索场景的能力至关重要。在本工作中,我们首先为 KILTs 引入了持续文档学习(CDL)任务,并基于原始 KILT 数据集构建了一个名为 KILT++ 的新基准数据集用于评估。随后,我们对预训练 CorpusBrain 在 KILT++ 上的表现进行了全面研究。与在静态场景中的优异结果不同,CorpusBrain 在动态场景中容易发生灾难性遗忘,从而阻碍了检索性能。为缓解这一问题,我们提出了 CorpusBrain++,一种持续生成式预训练框架。实证结果表明,与传统方法和生成式信息检索(IR)方法相比,CorpusBrain++ 具有显著的效率和卓越的效果。
引用
@article{arxiv.2402.16767,
title = {CorpusBrain++: A Continual Generative Pre-Training Framework for Knowledge-Intensive Language Tasks},
author = {Jiafeng Guo and Changjiang Zhou and Ruqing Zhang and Jiangui Chen and Maarten de Rijke and Yixing Fan and Xueqi Cheng},
journal= {arXiv preprint arXiv:2402.16767},
year = {2024}
}
备注
Submitted to ACM Transactions on Information Systems