STARC:用于阅读理解的结构化标注框架
计算与语言
2020-05-01 v1
摘要
我们提出 STARC(用于阅读理解的结构化标注,Structured Annotations for Reading Comprehension),一种用于通过多项选择题评估阅读理解的新标注框架。我们的框架为答案选项引入了有原则的结构,并将其与文本片段标注相关联。该框架在 OneStopQA 中实现,这是一个用于英语阅读理解评估与分析的高质量新数据集。我们使用该数据集证明,STARC 可用于开发类似 SAT 的阅读理解材料这一关键新应用:通过片段消融实验自动探测标注质量。我们进一步表明,它支持对机器与人类阅读理解行为进行深入分析与比较,包括错误分布与猜测能力。我们的实验还揭示,NLP 中的标准多项选择题数据集 RACE 在衡量阅读理解能力方面存在局限:47% 的题目可被机器在无需访问文章的情况下猜出,18% 被人类一致判定为没有唯一正确答案。OneStopQA 提供了一个替代性的阅读理解测试集,缓解了这些缺陷,并具有显著更高的人类上限表现。
引用
@article{arxiv.2004.14797,
title = {STARC: Structured Annotations for Reading Comprehension},
author = {Yevgeni Berzak and Jonathan Malmaud and Roger Levy},
journal= {arXiv preprint arXiv:2004.14797},
year = {2020}
}
备注
ACL 2020. OneStopQA dataset, STARC guidelines and human experiments data are available at https://github.com/berzak/onestop-qa