重新审视文本数据增强的有效性:一项实证分析
计算与语言
2023-06-14 v1 人工智能
机器学习
摘要
近年来,语言模型(LMs)在推动自然语言处理(NLP)领域发展方面取得了显著进展。然而,数据增强(DA)技术对这些 LMs 微调(FT)性能的影响一直是一个持续争论的话题。在本研究中,我们评估了三种不同 FT 方法与回译相结合在 7 项不同 NLP 任务(包括分类与回归类型,涵盖单句与句对任务)上的有效性。与先前认为 DA 无助于提升 LMs 的 FT 性能的假设相反,我们的研究结果表明,在增强数据上继续预训练可以有效改善下游任务的 FT 性能。在最有利的情况下,继续预训练在少样本学习设定下将 FT 性能提升了超过 10%。我们的发现凸显了 DA 作为一种强化 LMs 性能的有力工具的潜力。
引用
@article{arxiv.2306.07664,
title = {Rethink the Effectiveness of Text Data Augmentation: An Empirical Analysis},
author = {Zhengxiang Shi and Aldo Lipani},
journal= {arXiv preprint arXiv:2306.07664},
year = {2023}
}
备注
Accepted at ESANN 2023