中文

EPiDA:一种用于高性能文本分类的易插拔数据增强框架

计算与语言 2022-04-26 v1

摘要

近期工作已在经验上展示了数据增强(DA)在 NLP 任务中的有效性,尤其是那些受数据稀缺困扰的任务。直观上,给定生成数据的数量,其多样性和质量对目标任务的性能至关重要。然而,据我们所知,现有多数方法仅考虑增强数据的多样性或质量之一,因而无法充分挖掘 DA 在 NLP 中的潜力。本文中,我们提出一个简易且可插拔的数据增强框架 EPiDA 以支持有效的文本分类。EPiDA 采用两种机制:相对熵最大化(REM)和条件熵最小化(CEM)来控制数据生成,其中 REM 用于增强增强数据的多样性,而 CEM 用于保证其语义一致性。EPiDA 能够支持高效且连续的数据生成以训练有效分类器。大量实验表明,尽管未使用任何智能体网络或预训练生成网络,EPiDA 在大多数情况下优于现有 SOTA 方法,并且它能与多种 DA 算法和分类模型良好协作。代码见 https://github.com/zhaominyiz/EPiDA。

关键词

引用

@article{arxiv.2204.11205,
  title  = {EPiDA: An Easy Plug-in Data Augmentation Framework for High Performance Text Classification},
  author = {Minyi Zhao and Lu Zhang and Yi Xu and Jiandong Ding and Jihong Guan and Shuigeng Zhou},
  journal= {arXiv preprint arXiv:2204.11205},
  year   = {2022}
}

备注

Accepted by NAACL2022