中文

自然语言处理中的数据增强方法:综述

计算与语言 2022-06-28 v3 人工智能 机器学习

摘要

作为一种有效策略,数据增强(DA)缓解了深度学习技术可能失效的数据稀缺场景。它广泛应用于计算机视觉,随后被引入自然语言处理,并在许多任务中取得改进。DA方法的主要关注点之一是提高训练数据的多样性,从而帮助模型更好地泛化到未见的测试数据。在本综述中,我们根据增强数据的多样性将DA方法划分为三类,包括复述、加噪和采样。本文旨在根据上述类别详细分析DA方法。此外,我们还介绍了它们在NLP任务中的应用以及面临的挑战。附录中提供了一些有用的资源。

关键词

引用

@article{arxiv.2110.01852,
  title  = {Data Augmentation Approaches in Natural Language Processing: A Survey},
  author = {Bohan Li and Yutai Hou and Wanxiang Che},
  journal= {arXiv preprint arXiv:2110.01852},
  year   = {2022}
}

备注

accepted by AI Open (2022) at https://www.sciencedirect.com/science/article/pii/S2666651022000080 ; 55 pages, 12 figures, 3 tables