过于脆弱而不可触碰:比较量化与蒸馏的稳定性以开发轻量级低资源机器翻译模型
计算与语言
2022-11-10 v2
摘要
通过大规模多语言模型利用共享学习,最先进的机器翻译模型通常能够适应低资源语言的数据匮乏问题。然而,这种性能是以模型显著臃肿为代价的,在实际中无法部署。知识蒸馏是开发具有竞争力的轻量级模型的一种流行技术:在本工作中,我们首先评估了其在压缩机器翻译模型方面的应用,重点关注训练数据极其有限的语言。通过对8种语言的分析,我们发现蒸馏模型性能的方差(源于其对先验的依赖,包括用于蒸馏的合成数据量、学生模型架构、训练超参数以及教师模型的置信度)使得蒸馏成为一种脆弱的压缩机制。为了缓解这一问题,我们探索了使用训练后量化来压缩这些模型。在此,我们发现尽管蒸馏在一些低资源语言上带来了增益,但量化在所有语言范围内提供了更一致的性能趋势,特别是我们目标集中资源最少的语言。
引用
@article{arxiv.2210.15184,
title = {Too Brittle To Touch: Comparing the Stability of Quantization and Distillation Towards Developing Lightweight Low-Resource MT Models},
author = {Harshita Diddee and Sandipan Dandapat and Monojit Choudhury and Tanuja Ganu and Kalika Bali},
journal= {arXiv preprint arXiv:2210.15184},
year = {2022}
}
备注
16 Pages, 7 Figures, Accepted to WMT 2022 (Research Track)