中文

基于预训练 Transformer 模型的数据增强

计算与语言 2021-02-02 v2 机器学习

摘要

基于语言模型的预训练模型(如 BERT)已在各项 NLP 任务中带来显著提升。本文中,我们研究不同类型的基于 transformer 的预训练模型,如自回归模型(GPT-2)、自编码器模型(BERT)与 seq2seq 模型(BART),用于条件数据增强。我们表明,将类标签前置到文本序列提供了一种简单而有效的方式来条件化预训练模型以进行数据增强。此外,在三个分类基准上,预训练 Seq2Seq 模型在低资源设定下优于其他数据增强方法。进一步,我们探究不同预训练模型的数据增强在数据多样性上有何差异,以及此类方法在多大程度上保留类标签信息。

关键词

引用

@article{arxiv.2003.02245,
  title  = {Data Augmentation using Pre-trained Transformer Models},
  author = {Varun Kumar and Ashutosh Choudhary and Eunah Cho},
  journal= {arXiv preprint arXiv:2003.02245},
  year   = {2021}
}

备注

In Proceedings of the 2nd Workshop on Life-long Learning for Spoken Language Systems @ AACL 2020; Code: https://github.com/varinf/TransformersDataAugmentation