DQI:自然语言处理中的数据质量度量
计算与语言
2020-05-05 v1
摘要
神经语言模型已在多个NLP数据集上达到人类水平性能。然而,近期研究表明这些模型并未真正学习到期望的任务;相反,其高性能归因于利用虚假偏置的过拟合,这意味着AI系统的能力被高估了。我们提出一种用于数据质量指数(Data Quality Index, DQI)的通用公式,以帮助数据集创建者构建无此类不良偏置的数据集。我们使用近期提出的对抗过滤方法AFLite对该公式进行评估。我们提出一种利用DQI创建更高质量数据的新数据创建范式。该数据创建范式包含若干数据可视化方法,以帮助数据创建者(i)理解数据质量以及(ii)可视化所创建数据实例对整体质量的影响。它还包括若干自动化方法以(i)辅助数据创建者以及(ii)使模型对对抗攻击更鲁棒。我们使用DQI及这些自动化方法改造SNLI中的偏置样本。我们表明,在改造后的SNLI数据集上训练的模型能更好地泛化至分布外任务。改造导致模型性能下降,暴露出与人类性能之间的巨大差距。DQI通过主动学习系统性地帮助创建更难的基准。我们的工作推进了动态数据集创建过程,其中数据集与不断演进的技术水平共同演化,从而作为衡量AI真正进展的一种手段。
引用
@article{arxiv.2005.00816,
title = {DQI: Measuring Data Quality in NLP},
author = {Swaroop Mishra and Anjana Arunkumar and Bhavdeep Sachdeva and Chris Bryan and Chitta Baral},
journal= {arXiv preprint arXiv:2005.00816},
year = {2020}
}
备注
63 pages