神经机器翻译的高效推理
计算与语言
2020-10-08 v2 机器学习
摘要
大型 Transformer 模型已在神经机器翻译中取得最先进的结果,并成为该领域的标准。在本工作中,我们寻找已知技术的最优组合,以在不牺牲翻译质量的前提下优化推理速度。我们开展了一项实证研究,堆叠多种方法并证明:将解码器自注意力替换为简化的循环单元、采用深编码器与浅解码器架构以及多头注意力剪枝的组合,在 CPU 和 GPU 上分别可实现高达 109% 和 84% 的加速,并将参数量减少 25%,同时在 BLEU 指标上保持相同的翻译质量。
引用
@article{arxiv.2010.02416,
title = {Efficient Inference For Neural Machine Translation},
author = {Yi-Te Hsu and Sarthak Garg and Yi-Hsiu Liao and Ilya Chatsviorkin},
journal= {arXiv preprint arXiv:2010.02416},
year = {2020}
}
备注
Accepted SustaiNLP 2020