GenAug:用于微调文本生成器的数据增强
计算与语言
2020-10-13 v2 人工智能
机器学习
摘要
在本文中,我们研究用于文本生成的数据增强,称之为 GenAug。文本生成与语言建模是自然语言处理中的重要任务,尤其在低数据场景下尤其具有挑战性。我们提出并评估了多种增强方法,包括一些融合外部知识的方法,用于在 Yelp Reviews 子集上微调 GPT-2。我们还考察了增强数据量与生成文本质量之间的关系。我们采用了若干评估生成文本重要方面(包括多样性和流畅性)的指标。我们的实验表明,插入字符级合成噪声与用上位词替换关键词是有效的增强方法,且生成质量在约三倍于原始数据量时达到峰值。
引用
@article{arxiv.2010.01794,
title = {GenAug: Data Augmentation for Finetuning Text Generators},
author = {Steven Y. Feng and Varun Gangal and Dongyeop Kang and Teruko Mitamura and Eduard Hovy},
journal= {arXiv preprint arXiv:2010.01794},
year = {2020}
}
备注
EMNLP 2020 Deep Learning Inside Out (DeeLIO) Workshop; Code available at https://github.com/styfeng/GenAug