随机文本扰动有效,但并非总是有效
计算与语言
2022-10-04 v2
摘要
我们在中英文二进制文本匹配分类任务上进行了三个大规模实验,以评估随机文本扰动作为NLP数据增强方法的有效性和泛化能力。研究发现,这种增强会对三个神经分类模型的测试集性能产生负面和正面两种影响,取决于模型是否在足够的原始训练样本上训练。无论用于增强文本的五种随机文本编辑操作是一起应用还是分开应用,这一结论都成立。我们的研究以强烈的暗示表明,随机文本扰动的有效性是任务特定的,并非普遍为正。
引用
@article{arxiv.2209.00797,
title = {Random Text Perturbations Work, but not Always},
author = {Zhengxiang Wang},
journal= {arXiv preprint arXiv:2209.00797},
year = {2022}
}
备注
7 pages; 8 tables; 3 figures