FastSeq:加速序列生成
计算与语言
2021-07-14 v2 机器学习
摘要
基于 Transformer 的模型在自然语言生成中产生了巨大影响。然而,由于模型规模大以及自回归解码过程中涉及密集计算,推理速度成为瓶颈。我们开发了 FastSeq 框架以在不损失精度的情况下加速序列生成。所提出的优化技术包括注意力缓存优化、用于检测重复 n-gram 的高效算法,以及带有并行 I/O 的异步生成流水线。这些优化具有足够的通用性,可应用于基于 Transformer 的模型(如 T5、GPT2 和 UniLM)。我们在一组广泛使用且多样的模型上的基准测试结果表明获得了 4–9 倍的推理速度提升。此外,FastSeq 易于使用,仅需一行代码修改。源代码可在 https://github.com/microsoft/fastseq 获取。
引用
@article{arxiv.2106.04718,
title = {FastSeq: Make Sequence Generation Faster},
author = {Yu Yan and Fei Hu and Jiusheng Chen and Nikhil Bhendawade and Ting Ye and Yeyun Gong and Nan Duan and Desheng Cui and Bingyu Chi and Ruofei Zhang},
journal= {arXiv preprint arXiv:2106.04718},
year = {2021}
}
备注
ACL 2021 Demo Track