中文

MobileNMT:在 15MB 与 30ms 下实现翻译

人工智能 2023-06-08 v1 机器学习

摘要

在移动设备上部署 NMT(神经机器翻译)模型对于隐私、低延迟和离线场景至关重要。出于高模型容量的考虑,NMT 模型通常相当庞大。在存储、内存、计算和功耗受限的设备上运行这些模型具有挑战性。现有工作要么仅关注单一指标(如 FLOPs),要么是通用引擎但不擅长自回归解码。本文提出 MobileNMT,一个可在设备上以 15MB 和 30ms 完成翻译的系统。我们提出了一系列结合量化进行模型压缩的原则。此外,我们实现了一个对 INT8 和解码友好的引擎。通过模型与引擎的协同设计,相比现有系统,我们加速了 47.0 倍,节省了 99.5% 的内存,而 BLEU 仅损失 11.6%。代码公开于 https://github.com/zjersey/Lightseq-ARM。

关键词

引用

@article{arxiv.2306.04235,
  title  = {MobileNMT: Enabling Translation in 15MB and 30ms},
  author = {Ye Lin and Xiaohui Wang and Zhexi Zhang and Mingxuan Wang and Tong Xiao and Jingbo Zhu},
  journal= {arXiv preprint arXiv:2306.04235},
  year   = {2023}
}

备注

accepted by ACL2023 Industry Track