利用 Mixup 训练改进非自回归生成
计算与语言
2021-10-22 v1
摘要
尽管预训练语言模型在各种自然语言理解任务上取得了巨大成功,如何将其有效引入非自回归生成任务仍是一项挑战。为解决该问题,我们提出了一种基于预训练 transformer 模型的非自回归生成模型。为弥合自回归与非自回归模型之间的差距,我们提出了一种简单而有效的迭代训练方法,称为混合源与伪目标(MIST)。与其他基于多次解码迭代以牺牲推理速度为代价获得更好性能的迭代解码方法不同,MIST 作用于训练阶段且不影响推理时间。我们在包括问题生成、摘要和复述生成的三个生成基准上的实验表明,所提框架在完全非自回归模型中取得了新的 SOTA 结果。我们还证明了我们的方法可用于多种预训练模型。例如,基于小型预训练模型的 MIST 也取得了与 seq2seq 模型相当的性能。
引用
@article{arxiv.2110.11115,
title = {Improving Non-autoregressive Generation with Mixup Training},
author = {Ting Jiang and Shaohan Huang and Zihan Zhang and Deqing Wang and Fuzhen Zhuang and Furu Wei and Haizhen Huang and Liangjie Zhang and Qi Zhang},
journal= {arXiv preprint arXiv:2110.11115},
year = {2021}
}