中文

问答数据集爆发:面向问答与阅读理解的自然语言处理资源分类体系

计算与语言 2022-09-20 v2 人工智能

摘要

近年来,伴随着 NLP 中深度学习模型研究的海量工作,也有许多关于追踪建模进展所需基准数据集的工作。问答与阅读理解在这方面尤其多产,过去两年出现了超过 80 个新数据集。本研究是该领域迄今为止最大的综述。我们概述了当前资源的各种格式与领域,突出了未来工作的当前空白。我们进一步讨论了当前对问答/阅读理解系统应习得的“技能”的分类,并提出了一种新的分类体系。补充材料调研了当前多语言资源及英语以外语言的单语资源,并讨论了过度聚焦英语的影响。本研究既面向寻找现有数据丰富指引的从业者,也面向从事新资源的研究者。

关键词

引用

@article{arxiv.2107.12708,
  title  = {QA Dataset Explosion: A Taxonomy of NLP Resources for Question Answering and Reading Comprehension},
  author = {Anna Rogers and Matt Gardner and Isabelle Augenstein},
  journal= {arXiv preprint arXiv:2107.12708},
  year   = {2022}
}

备注

Published in ACM Comput. Surv (2022). This version differs from the final version in that section 7 ("Languages") is not in the main paper rather than the supplementary materials