中文

CCQA:一个用于模型预训练的新型网络级问答数据集

计算与语言 2022-05-03 v2 机器学习

摘要

随着大规模预训练语言模型的兴起,开放域问答(ODQA)已成为NLP中的重要研究课题。基于流行的预训练-微调方法,我们假设使用大规模、自然且多样的问答(QA)数据集进行额外的领域内预训练阶段对ODQA是有益的。因此,我们在本文中提出了一个基于 Common Crawl 项目的新型QA数据集。利用现成的 schema.org 标注,我们提取了约1.3亿对多语言问答数据,其中包含约6000万个英语数据点。凭借这一前所未有数量的自然问答对,我们对流行的语言模型进行了预训练,以展示大规模领域内预训练在问答任务中的潜力。在我们的实验中,我们发现基于我们的 Common Crawl 问答数据集(CCQA)预训练的问答模型在多个任务、模型和基准测试的零样本、低资源和微调设置下均取得了令人满意的结果。

关键词

引用

@article{arxiv.2110.07731,
  title  = {CCQA: A New Web-Scale Question Answering Dataset for Model Pre-Training},
  author = {Patrick Huber and Armen Aghajanyan and Barlas Oğuz and Dmytro Okhonko and Wen-tau Yih and Sonal Gupta and Xilun Chen},
  journal= {arXiv preprint arXiv:2110.07731},
  year   = {2022}
}

备注

9 pages, Findings of NAACL 2022