利用知识蒸馏压缩多语言神经机器翻译模型的实证研究
计算与语言
2023-04-20 v1 人工智能
摘要
知识蒸馏(KD)是一种众所周知的压缩神经网络模型的方法。然而,尽管多语言神经机器翻译(MNMT)模型广受青睐且表现优越,聚焦于将大型 MNMT 模型的知识蒸馏至更小模型的工作实际上几乎不存在。本文通过呈现一项关于利用知识蒸馏压缩 MNMT 模型的实证研究来填补这一空白。我们以印度语到英语的翻译为案例,证明常用的语言无关与语言相关 KD 方法所得模型体积小 4–5 倍,但 BLEU 分数最高下降 3.5。为缓解此问题,我们进而尝试了浅层 versus 深层模型、重度参数共享、多阶段训练及适配器等设计考量。我们观察到更深的紧凑模型往往与更浅的非紧凑模型表现相当,且在高质量子集上微调蒸馏模型可轻微提升翻译质量。总体而言,我们得出结论:通过 KD 压缩 MNMT 模型颇具挑战,表明其有巨大进一步研究空间。
引用
@article{arxiv.2304.09388,
title = {An Empirical Study of Leveraging Knowledge Distillation for Compressing Multilingual Neural Machine Translation Models},
author = {Varun Gumma and Raj Dabre and Pratyush Kumar},
journal= {arXiv preprint arXiv:2304.09388},
year = {2023}
}
备注
accepted at EAMT 2023