Disfl-QA:用于理解问答中不流畅现象的基准数据集
计算与语言
2021-06-09 v1
摘要
不流畅现象在自然语言处理(NLP)中是一个研究不足的主题,尽管它在人类对话中无处不在。这在很大程度上是由于缺乏包含不流畅现象的数据集。在本文中,我们提出一个新的挑战性问答数据集 Disfl-QA,它是 SQuAD 的衍生数据集,由人类在先前流畅的问题中引入上下文不流畅现象而成。Disfl-QA 包含多种具有挑战性的不流畅现象,需要对文本有比先前数据集所必需的更全面的理解。实验表明,现有的最先进问答模型在零样本设置下于 Disfl-QA 上测试时性能显著下降。我们展示了数据增强方法可部分恢复性能损失,并证明了使用黄金数据进行微调的有效性。我们认为,NLP 模型要对其具有鲁棒性,就需要大规模的不流畅现象数据集。该数据集公开于:https://github.com/google-research-datasets/disfl-qa。
引用
@article{arxiv.2106.04016,
title = {Disfl-QA: A Benchmark Dataset for Understanding Disfluencies in Question Answering},
author = {Aditya Gupta and Jiacheng Xu and Shyam Upadhyay and Diyi Yang and Manaal Faruqui},
journal= {arXiv preprint arXiv:2106.04016},
year = {2021}
}
备注
Findings of ACL 2021