WikiOmnia:基于全俄文维基百科的生成式问答语料库
计算与语言
2022-11-11 v3 人工智能
摘要
通用问答领域一直发展着以Stanford Question Answering Dataset(SQuAD)为重要基准的方法论。然而,编写事实性问题伴随耗时耗力的标注,限制了训练数据的潜在规模。我们提出WikiOmnia数据集,这是一个全新公开可用的QA对及相应俄文维基百科文章摘要段落集合,通过全自动化生成流水线构建。该数据集涵盖俄文维基百科中所有可用文章。WikiOmnia流水线已开源,并经过在其他领域(如新闻文本、小说和社交媒体)创建SQuAD格式QA的测试。最终数据集包含两部分:全俄文维基百科原始数据(ruGPT-3 XL对应7,930,873个带段落的QA对,ruT5-large对应7,991,040个带段落的QA对)以及经严格自动校验的清洗数据(ruGPT-3 XL对应超过160,000个带段落的QA对,ruT5-large对应超过3,400,000个带段落的QA对)。
引用
@article{arxiv.2204.08009,
title = {WikiOmnia: generative QA corpus on the whole Russian Wikipedia},
author = {Dina Pisarevskaya and Tatiana Shavrina},
journal= {arXiv preprint arXiv:2204.08009},
year = {2022}
}
备注
Accepted to GEM Workshop, EMNLP 2022