面向低资源语言的多假设蒸馏多语言神经翻译模型
计算与语言
2025-08-01 v2
摘要
本文探讨了多语言预训练编码器-解码器翻译模型的序列级知识蒸馏(KD)。我们认为教师模型的输出分布为学生模型提供了宝贵的见解,超越了通过束搜索(标准解码方法)获得的近似模式,本文提出了多假设蒸馏(MHD),一种生成每个源句子多个翻译的序列级KD方法。这为学生模型提供了更大的教师模型分布表示,并使其暴露于更广泛的目标侧前缀。我们利用束搜索的n-best列表引导学生的学习,并检查其他解码方法以解决低变异性和稀有标记欠表示的问题。对于低资源语言,我们的研究表明,虽然采样方法在质量上略逊于基于束搜索的方法,但它们为生成的语料库带来了更大的变异性和词汇丰富性。这最终提高了学生模型的性能,并缓解了知识蒸馏常associated的性别偏置放大问题。
引用
@article{arxiv.2507.21568,
title = {Multi-Hypothesis Distillation of Multilingual Neural Translation Models for Low-Resource Languages},
author = {Aarón Galiano-Jiménez and Juan Antonio Pérez-Ortiz and Felipe Sánchez-Martínez and Víctor M. Sánchez-Cartagena},
journal= {arXiv preprint arXiv:2507.21568},
year = {2025}
}
备注
17 pages, 12 figures