中文

CoDA:面向自然语言理解的对比增强与多样性促进数据增强

计算与语言 2020-10-20 v1

摘要

数据增强已被证明是提升模型泛化与数据效率的有效策略。然而,由于自然语言的离散性,为文本数据设计保持标签的变换往往更具挑战性。本文提出一种称为CoDA的新型数据增强框架,其通过有机整合多种变换来合成多样且信息丰富的增强样本。此外,引入对比正则化目标以捕获所有数据样本间的全局关系。进一步利用动量编码器与记忆库来更好地估计对比损失。为验证所提框架的有效性,我们将CoDA应用于基于Transformer的模型于广泛的自然语言理解任务。在GLUE基准上,CoDA应用于RoBERTa-large模型时带来平均2.2%的提升。更重要的是,相对于若干竞争性的数据增强与对抗训练基线(包括低资源设定),它持续展现出更强结果。大量实验表明,所提对比目标可灵活结合多种数据增强方法以进一步提升其性能,凸显了CoDA框架的广泛适用性。

关键词

引用

@article{arxiv.2010.08670,
  title  = {CoDA: Contrast-enhanced and Diversity-promoting Data Augmentation for Natural Language Understanding},
  author = {Yanru Qu and Dinghan Shen and Yelong Shen and Sandra Sajeev and Jiawei Han and Weizhu Chen},
  journal= {arXiv preprint arXiv:2010.08670},
  year   = {2020}
}