SDA:利用自数据增强改进文本生成
计算与语言
2021-01-12 v1 机器学习
摘要
数据增强已广泛用于改进许多研究领域(如计算机视觉)中的深度神经网络。然而,由于文本的离散性和自然语言的复杂性,在文本领域所做的工作较少。本文中,我们提出通过引入用于自动数据增强的自模仿学习阶段来改进标准最大似然估计(MLE)范式。与大多数仅应用于特定模型的现有句子级增强策略不同,我们的方法更具通用性,可轻松适配任何基于 MLE 的训练过程。此外,我们的框架允许设计任务特定的评估指标来灵活控制生成的句子,例如控制词汇使用并避免非平凡重复。大量实验结果证明了我们的方法在两个合成数据集和几个标准真实数据集上的优越性,显著改进了相关基线。
引用
@article{arxiv.2101.03236,
title = {SDA: Improving Text Generation with Self Data Augmentation},
author = {Ping Yu and Ruiyi Zhang and Yang Zhao and Yizhe Zhang and Chunyuan Li and Changyou Chen},
journal= {arXiv preprint arXiv:2101.03236},
year = {2021}
}