C-MORE:通过参考数百万文献进行预训练以回答开放域问题
计算与语言
2022-03-23 v2
摘要
我们考虑对具有强迁移能力的二阶段开放域问答(QA)系统(检索器+阅读器)进行预训练的问题。关键挑战是如何在没有任务特定标注的情况下构建大量高质量的问题-答案-上下文三元组。具体而言,这些三元组应通过以下方式很好地与下游任务对齐:(i) 覆盖广泛领域(用于开放域应用),(ii) 将问题与具有支持证据的语义相关上下文相链接(用于训练检索器),以及 (iii) 在上下文中识别正确答案(用于训练阅读器)。以往的预训练方法通常无法满足上述一项或多项要求。在本工作中,我们通过参考维基百科中引用的数百万篇文献,自动构建了一个满足所有三项标准的大规模语料库。良好对齐的预训练信号显著有益于检索器和阅读器。我们预训练的检索器在 top-20 准确率上带来了 2%–10% 的绝对提升。并且使用我们预训练的阅读器,整个系统在精确匹配上提升了高达 4%。
引用
@article{arxiv.2203.08928,
title = {C-MORE: Pretraining to Answer Open-Domain Questions by Consulting Millions of References},
author = {Xiang Yue and Xiaoman Pan and Wenlin Yao and Dian Yu and Dong Yu and Jianshu Chen},
journal= {arXiv preprint arXiv:2203.08928},
year = {2022}
}
备注
ACL 2022 Main Conference