中文

重新审视文本数据增强的有效性:一项实证分析

计算与语言 2023-06-14 v1 人工智能 机器学习

摘要

近年来,语言模型(LMs)在推动自然语言处理(NLP)领域发展方面取得了显著进展。然而,数据增强(DA)技术对这些 LMs 微调(FT)性能的影响一直是一个持续争论的话题。在本研究中,我们评估了三种不同 FT 方法与回译相结合在 7 项不同 NLP 任务(包括分类与回归类型,涵盖单句与句对任务)上的有效性。与先前认为 DA 无助于提升 LMs 的 FT 性能的假设相反,我们的研究结果表明,在增强数据上继续预训练可以有效改善下游任务的 FT 性能。在最有利的情况下,继续预训练在少样本学习设定下将 FT 性能提升了超过 10%。我们的发现凸显了 DA 作为一种强化 LMs 性能的有力工具的潜力。

关键词

引用

@article{arxiv.2306.07664,
  title  = {Rethink the Effectiveness of Text Data Augmentation: An Empirical Analysis},
  author = {Zhengxiang Shi and Aldo Lipani},
  journal= {arXiv preprint arXiv:2306.07664},
  year   = {2023}
}

备注

Accepted at ESANN 2023