中文

一种简单却难以击败的自然语言理解与生成数据增强方法

计算与语言 2020-10-26 v2 人工智能

摘要

对抗训练已被证明能有效赋予所学表征更强的泛化能力。然而,它通常需要昂贵的计算来确定注入扰动的方向。在本文中,我们引入一组简单而有效的数据增强策略,称为 cutoff,即在微调阶段擦除输入句子中的部分信息以产生其受限视图。值得注意的是,该过程仅依赖随机采样,因此几乎不增加计算开销。进一步利用 Jensen-Shannon 散度一致性损失,以原则性方式将这些增强样本纳入训练目标。为验证所提策略的有效性,我们将 cutoff 应用于自然语言理解与生成问题。在 GLUE 基准上,结果表明 cutoff 尽管简单,其表现与若干有竞争力的基于对抗的方法相当或更优。我们进一步将 cutoff 扩展到机器翻译,并观察到 BLEU 分数显著提升(基于 Transformer Base 模型)。此外,cutoff 持续优于对抗训练,并在 IWSLT2014 德英数据集上取得最先进结果。

关键词

引用

@article{arxiv.2009.13818,
  title  = {A Simple but Tough-to-Beat Data Augmentation Approach for Natural Language Understanding and Generation},
  author = {Dinghan Shen and Mingzhi Zheng and Yelong Shen and Yanru Qu and Weizhu Chen},
  journal= {arXiv preprint arXiv:2009.13818},
  year   = {2020}
}

备注

Source code is available at: https://github.com/dinghanshen/cutoff