中文

面向开放域问答的渐进式预训练稠密语料索引

计算与语言 2021-02-22 v2

摘要

为从大规模语料中抽取答案,开放域问答(QA)系统通常依赖信息检索(IR)技术来缩小搜索空间。诸如 TF-IDF 等标准倒排索引方法因其高效性而被广泛使用。然而,其检索性能受限,因为它们仅使用浅层且稀疏的词汇特征。为突破 IR 瓶颈,近期研究表明,通过预训练一个有效的段落编码器将段落索引为稠密向量,可获得更强的检索性能。一旦训练完成,语料可被预先编码为低维向量并存储于索引结构中,其中检索可高效地以最大内积搜索实现。尽管结果令人鼓舞,预训练此类稠密索引代价高昂且常需非常大的批量大小。本工作中,我们提出一种简单且资源高效的段落编码器预训练方法。首先,不同于使用启发式构造的伪问题-段落对进行预训练,我们利用已有的预训练序列到序列模型构建强大的问题生成器以创建高质量预训练数据。其次,我们提出一种渐进式预训练算法,以确保每个批量中均存在有效的负样本。在三个数据集上,我们的方法优于一种使用多 7 倍计算资源进行预训练的现有稠密检索方法。

关键词

引用

@article{arxiv.2005.00038,
  title  = {Progressively Pretrained Dense Corpus Index for Open-Domain Question Answering},
  author = {Wenhan Xiong and Hong Wang and William Yang Wang},
  journal= {arXiv preprint arXiv:2005.00038},
  year   = {2021}
}

备注

EACL 2021