QuALITY:面向长输入文本的问答数据集
计算与语言
2022-05-12 v2
摘要
为支持在长文档理解上构建和测试模型,我们引入了 QuALITY,一个英文上下文段落的多项选择问答数据集,其平均长度约为 5000 个 token,远长于典型当前模型所能处理的长度。与以往基于段落的工作不同,我们的问题由已通读整个段落的贡献者撰写并验证,而非依赖摘要或节选。此外,仅有半数问题可由在紧迫时间限制下工作的标注者回答,表明略读和简单搜索不足以稳定取得良好表现。我们的基线模型在该任务上表现糟糕(55.4%),并显著落后于人类表现(93.5%)。
引用
@article{arxiv.2112.08608,
title = {QuALITY: Question Answering with Long Input Texts, Yes!},
author = {Richard Yuanzhe Pang and Alicia Parrish and Nitish Joshi and Nikita Nangia and Jason Phang and Angelica Chen and Vishakh Padmakumar and Johnny Ma and Jana Thompson and He He and Samuel R. Bowman},
journal= {arXiv preprint arXiv:2112.08608},
year = {2022}
}
备注
NAACL 2022