中文

面向知识密集型 NLP 任务的证据性引导生成

计算与语言 2022-05-17 v2

摘要

检索增强生成模型在许多知识密集型 NLP 任务(如开放问答和事实验证)中展现了最先进的性能。这些模型被训练为在给定检索到的段落的情况下生成最终输出,而这些段落可能与原始查询无关,导致学习虚假线索或答案记忆。本文引入一种方法,将段落的证据性——即段落是否包含支持输出的正确证据——纳入生成器的训练。我们引入一个多任务学习框架,联合生成最终输出并预测每个段落的证据性,利用一种与任务无关的新方法获取银标证据性标签用于监督。我们在三个知识密集型任务上的五个数据集上的实验表明,我们新的证据性引导生成器显著优于同等规模模型的直接对应模型,并在 FaVIQ-Ambig 上推进了最先进水平。我们将这些改进归因于辅助多任务学习和银标证据性挖掘技术。

关键词

引用

@article{arxiv.2112.08688,
  title  = {Evidentiality-guided Generation for Knowledge-Intensive NLP Tasks},
  author = {Akari Asai and Matt Gardner and Hannaneh Hajishirzi},
  journal= {arXiv preprint arXiv:2112.08688},
  year   = {2022}
}

备注

Published as a conference paper at NAACL 2022 (long). Code available at https://github.com/AkariAsai/evidentiality_qa