中文

基于激进解码的 Seq2Seq 生成无损加速

计算与语言 2022-05-23 v1 机器学习

摘要

我们研究了一种用于 seq2seq 生成的无损加速方法,其采用一种新颖的解码算法——激进解码(Aggressive Decoding)。不同于以往以质量损失为代价加速 seq2seq 生成的努力(例如非自回归解码),我们的方法旨在产生与自回归解码完全相同(或更好)的生成结果,同时实现显著加速,这通过激进解码与验证的创新协作达成,二者均因并行计算而高效。我们针对两类 seq2seq 任务提出两种激进解码范式:1)对于输入输出高度相似(例如语法错误纠正)的 seq2seq 任务,我们提出输入引导的激进解码(IAD),其激进地从输入句中复制作为草稿解码词元并并行验证;2)对于其他通用 seq2seq 任务(例如机器翻译),我们提出广义激进解码(GAD),其首先使用额外的非自回归解码模型进行激进解码,然后以自回归方式并行验证。我们在 GPU 上对最流行的 6 层 Transformer 模型在多个 seq2seq 任务上测试激进解码:1)对于 IAD,我们展示其在语法错误纠正与文本简化任务中可为 Transformer 带来 7x-9x 加速,且结果与贪心解码完全相同;2)对于 GAD,我们在两个重要 seq2seq 任务——机器翻译与摘要生成中观察到 3x-5x 加速,且质量相同或更优。此外,激进解码可从更擅长并行计算的更强计算设备中获益更多。鉴于其无损质量以及显著且有前景的加速,我们相信激进解码在不久的将来可能演变为高效无损 seq2seq 生成的事实标准。

关键词

引用

@article{arxiv.2205.10350,
  title  = {Lossless Acceleration for Seq2seq Generation with Aggressive Decoding},
  author = {Tao Ge and Heming Xia and Xin Sun and Si-Qing Chen and Furu Wei},
  journal= {arXiv preprint arXiv:2205.10350},
  year   = {2022}
}

备注

24-page Microsoft Research Technical Report. Content overlap with arXiv:2106.04970 and arXiv:2203.16487