NLI 数据健全性检验:评估数据损坏对模型性能的影响
计算与语言
2021-04-13 v1
摘要
预训练神经语言模型在自然语言推理(NLI)任务上表现优异。但它们是否真正理解所处理序列的含义仍不清楚。我们提出一个新的诊断测试套件,用于评估某个数据集是否构成评测模型语义理解能力的良好测试平台。我们特别对广泛使用的基准(MNLI 和 ANLI)施加受控的损坏变换,包括移除整个词类并常导致无意义句子对。若模型在损坏数据上准确率仍高,则该数据集可能含有引导预测的统计偏差与伪迹。反之,模型准确率大幅下降表明原始数据集对模型推理能力提供了恰当挑战。因此,我们提出的控制手段可作为开发高质量 NLI 任务数据的碰撞测试。
引用
@article{arxiv.2104.04751,
title = {NLI Data Sanity Check: Assessing the Effect of Data Corruption on Model Performance},
author = {Aarne Talman and Marianna Apidianaki and Stergios Chatzikyriakidis and Jörg Tiedemann},
journal= {arXiv preprint arXiv:2104.04751},
year = {2021}
}
备注
NoDaLiDa 2021 camera ready