中文

一种用于非自回归生成的自主进度混合蒸馏方法

计算与语言 2022-05-24 v1

摘要

非自回归生成是一种序列生成范式,它去除了目标词元之间的依赖关系。通过以并行解码替代逐词元顺序解码,可有效降低文本生成延迟。然而,由于已知的多模态问题,非自回归(NAR)模型在各种语言生成任务上显著落后于自回归(AR)模型。在NAR模型中,BANG是首个基于英文无标注原始文本语料的大规模预训练模型。它将不同生成范式作为其预训练任务,包括采用多流策略的AR、NAR和半NAR信息流,并在无任何蒸馏技术的情况下取得最先进性能。然而,AR蒸馏已被证明是提升NAR性能的非常有效的方案。本文提出一种新颖的自主进度混合蒸馏方法,以进一步提升BANG的生成质量。首先,我们提出基于AR流知识的混合蒸馏策略。其次,我们通过自主进度学习促使模型聚焦于具有相同模态的样本。所提出的自主进度混合蒸馏算法提升了生成质量且不影响推理延迟。我们在摘要和问答生成任务上进行了大量实验以验证有效性。为进一步说明方法的商业价值,我们在真实广告应用中的三项生成任务上开展实验。商业数据上的实验结果表明了所提模型的有效性。与BANG相比,其BLEU分数获得显著提升;另一方面,与自回归生成方法相比,其速度提升超过7倍。

关键词

引用

@article{arxiv.2205.11162,
  title  = {A Self-Paced Mixed Distillation Method for Non-Autoregressive Generation},
  author = {Weizhen Qi and Yeyun Gong and Yelong Shen and Jian Jiao and Yu Yan and Houqiang Li and Ruofei Zhang and Weizhu Chen and Nan Duan},
  journal= {arXiv preprint arXiv:2205.11162},
  year   = {2022}
}