中文

GenAug:用于微调文本生成器的数据增强

计算与语言 2020-10-13 v2 人工智能 机器学习

摘要

在本文中,我们研究用于文本生成的数据增强,称之为 GenAug。文本生成与语言建模是自然语言处理中的重要任务,尤其在低数据场景下尤其具有挑战性。我们提出并评估了多种增强方法,包括一些融合外部知识的方法,用于在 Yelp Reviews 子集上微调 GPT-2。我们还考察了增强数据量与生成文本质量之间的关系。我们采用了若干评估生成文本重要方面(包括多样性和流畅性)的指标。我们的实验表明,插入字符级合成噪声与用上位词替换关键词是有效的增强方法,且生成质量在约三倍于原始数据量时达到峰值。

关键词

引用

@article{arxiv.2010.01794,
  title  = {GenAug: Data Augmentation for Finetuning Text Generators},
  author = {Steven Y. Feng and Varun Gangal and Dongyeop Kang and Teruko Mitamura and Eduard Hovy},
  journal= {arXiv preprint arXiv:2010.01794},
  year   = {2020}
}

备注

EMNLP 2020 Deep Learning Inside Out (DeeLIO) Workshop; Code available at https://github.com/styfeng/GenAug