基于聚类的GPU多语言机器翻译快速词表投影方法
计算与语言
2022-08-16 v1 机器学习
摘要
多语言神经机器翻译在使用 transformer 模型方面已展现出巨大成功。部署这些模型具有挑战性,因为它们通常需要针对多种语言使用较大的词表(vocab)规模。这限制了在最后的词表投影层中预测输出 token 的速度。为缓解这些挑战,本文提出了一种基于聚类的快速词表投影方法,可用于 GPU 上的多语言 transformer。首先,我们根据解码器输出的隐藏上下文向量离线将词表搜索空间划分为互不相交的簇,从而大幅减少词表投影所需的词表列数。其次,在推理时,所提方法在词表投影处为隐藏上下文向量预测簇与候选活跃 token。本文还分析了多语言设置下构建这些簇的不同方式。我们的结果显示,在 float16 GPU 推理中端到端速度提升高达 25%,同时保持 BLEU 分数并略微增加内存开销。所提方法将词表投影步骤本身加速了至多 2.6 倍。我们还进行了广泛的人工评估,以验证所提方法保留了原始模型的翻译质量。
引用
@article{arxiv.2208.06874,
title = {Fast Vocabulary Projection Method via Clustering for Multilingual Machine Translation on GPU},
author = {Hossam Amer and Young Jin Kim and Mohamed Afify and Hitokazu Matsushita and Hany Hassan Awadallah},
journal= {arXiv preprint arXiv:2208.06874},
year = {2022}
}
备注
12 pages, accepted at AMTA-2022 (Association for Machine Translation in the Americas Conference)