任务无关数据增强对预训练 Transformer 的有效性如何?
机器学习
2020-10-06 v1 人工智能
机器学习
摘要
任务无关形式的数据增强在计算机视觉中已被广泛证明有效,即便对预训练模型亦然。在 NLP 中,类似结果最常报告于低数据量情形、非预训练模型,或对预训练模型的情形性结果。本文中我们探究这些技术应用于预训练 transformer 时究竟有多有效。使用两种流行的任务无关数据增强方法(不为任何特定任务定制),即 Easy Data Augmentation(Wei 和 Zou,2019)与 Back-Translation(Sennrich 等,2015),我们对其在 5 个分类任务、6 个数据集和 3 种现代预训练 transformer 变体(包括 BERT、XLNet 和 RoBERTa)上的效果进行了系统考察。我们观察到负面结果:发现那些此前报告对非预训练模型有显著提升的技术,即便在训练数据有限时,也未能持续地改善预训练 transformer 的性能。我们希望这一实证分析有助于从业者了解数据增强技术可能在何处带来改进。
关键词
引用
@article{arxiv.2010.01764,
title = {How Effective is Task-Agnostic Data Augmentation for Pretrained Transformers?},
author = {Shayne Longpre and Yu Wang and Christopher DuBois},
journal= {arXiv preprint arXiv:2010.01764},
year = {2020}
}
备注
2 tables; 1 figure; EMNLP Findings