REALM:检索增强的语言模型预训练
计算与语言
2020-02-21 v1 机器学习
摘要
语言模型预训练已被证明能够捕获惊人的世界知识量,这对问答等 NLP 任务至关重要。然而,这些知识隐式存储在神经网络的参数中,需要越来越大的网络来覆盖更多事实。为了以更模块化和可解释的方式捕获知识,我们为语言模型预训练增强了一个潜在知识检索器,该检索器允许模型在预训练、微调和推理期间从如维基百科等大型语料库中检索并关注文档。我们首次展示了如何以无监督方式预训练此类知识检索器,使用掩码语言建模作为学习信号,并通过考虑数百万文档的检索步骤进行反向传播。我们通过在具有挑战性的开放域问答(Open-QA)任务上微调,证明了检索增强语言模型预训练(REALM)的有效性。我们在三个流行的 Open-QA 基准上,针对显式和隐式知识存储的最先进模型进行比较,发现我们以显著优势(绝对准确率 4-16%)超越所有先前方法,同时还提供了可解释性和模块化等定性优势。
引用
@article{arxiv.2002.08909,
title = {REALM: Retrieval-Augmented Language Model Pre-Training},
author = {Kelvin Guu and Kenton Lee and Zora Tung and Panupong Pasupat and Ming-Wei Chang},
journal= {arXiv preprint arXiv:2002.08909},
year = {2020}
}