反事实增强的SNLI训练数据并未比未增强数据带来更好的泛化能力
计算与语言
2020-10-13 v1
摘要
越来越多的工作表明,模型利用标注伪迹在标准众包基准——从众包工作者处收集以创建评测任务的数据集——上取得最先进性能,却仍在同一任务的域外样本上失败。近期工作探索使用反事实增强数据——通过对一组种子样本进行最小编辑以产生反事实标签而构建的数据——来增强与这些基准相关的训练数据,并构建泛化更好的更鲁棒分类器。然而,Khashabi等人(2020)发现,在控制数据集规模和收集成本时,此类增强在阅读理解任务上收效甚微。我们基于该工作,使用英语自然语言推理数据来测试模型泛化与鲁棒性,发现训练于反事实增强SNLI数据集的模型并未比规模相近的未增强数据集泛化更好,且反事实增强可能损害性能,产生对挑战样本更不鲁棒的模型。通过标准众包技术对自然语言理解数据进行反事实增强似乎并非收集训练数据的有效方式,且需要进一步的创新以使这一总体研究方向可行。
引用
@article{arxiv.2010.04762,
title = {Counterfactually-Augmented SNLI Training Data Does Not Yield Better Generalization Than Unaugmented Data},
author = {William Huang and Haokun Liu and Samuel R. Bowman},
journal= {arXiv preprint arXiv:2010.04762},
year = {2020}
}