中文

BET:一种用于基于 Transformer 的释义识别场景中简易数据增强的反向翻译方法

计算与语言 2020-09-29 v1

摘要

新近引入的深度学习架构,即 BERT、XLNet、RoBERTa 与 ALBERT,已被证明在若干 NLP 任务上具有鲁棒性。然而,在这些架构上训练的数据集在规模与泛化性上是固定的。为缓解此问题,我们应用了一种最廉价的方法来更新这些数据集。我们称此方法为 BET,通过它我们分析基于 transformer 架构上的反向翻译数据增强。使用 Google Translate API 及来自十个不同语系的十种中间语言,我们在基于 transformer 的框架中于自动释义识别背景下对结果进行了外部评估。我们的发现表明,BET 在 Microsoft Research Paraphrase Corpus (MRPC) 上将释义识别性能在准确率与 F1 分数上均提升超过 3%。我们还以 MRPC、Twitter Paraphrase Corpus (TPC) 与 Quora Question Pairs 的下采样版本分析了低数据情形下的增强。在许多低数据案例中,我们观察到模型从测试集上的失败切换到了合理的性能。结果证明 BET 是一种极具前景的数据增强技术:可推进现有数据集的当前最优水平,并在百样本规模的低数据情形下启动深度学习架构的使用。

关键词

引用

@article{arxiv.2009.12452,
  title  = {BET: A Backtranslation Approach for Easy Data Augmentation in Transformer-based Paraphrase Identification Context},
  author = {Jean-Philippe Corbeil and Hadi Abdi Ghadivel},
  journal= {arXiv preprint arXiv:2009.12452},
  year   = {2020}
}