网络即你的牡蛎——面向超大规模网络语料的知识密集型NLP
计算与语言
2022-05-26 v2 人工智能
信息检索
机器学习
摘要
为满足现实世界应用日益增长的需求,知识密集型NLP(KI-NLP)的研究应当通过捕捉真正开放域环境中的挑战来取得进展:网络规模的知识、缺乏结构、质量不一致与噪声。为此,我们提出了一种评估现有知识密集型任务的新设定,其中我们将背景语料推广为通用的网络快照。我们考察了一系列依赖知识(事实性或常识性)的NLP任务,并要求系统使用 CCNet 的一个子集——Sphere 语料——作为知识源。与在 KI-NLP 中常见的背景语料维基百科不同,Sphere 在数量级上更大,并且更好地反映了网络上知识的全部多样性。尽管存在潜在的覆盖缺口、规模挑战、缺乏结构和较低质量,我们发现,从 Sphere 中检索使得一个最先进(state of the art)的系统能够在若干任务上匹配甚至超越基于维基百科的模型。我们还观察到,虽然稠密索引在维基百科上可以胜过稀疏 BM25 基线,但在 Sphere 上这尚不可能。为促进进一步研究并最小化社区对专有、黑盒搜索引擎的依赖,我们共享了我们的索引、评估指标与基础设施。
引用
@article{arxiv.2112.09924,
title = {The Web Is Your Oyster - Knowledge-Intensive NLP against a Very Large Web Corpus},
author = {Aleksandra Piktus and Fabio Petroni and Vladimir Karpukhin and Dmytro Okhonko and Samuel Broscheit and Gautier Izacard and Patrick Lewis and Barlas Oğuz and Edouard Grave and Wen-tau Yih and Sebastian Riedel},
journal= {arXiv preprint arXiv:2112.09924},
year = {2022}
}