中文

面向低资源语言的多假设蒸馏多语言神经翻译模型

计算与语言 2025-08-01 v2

摘要

本文探讨了多语言预训练编码器-解码器翻译模型的序列级知识蒸馏(KD)。我们认为教师模型的输出分布为学生模型提供了宝贵的见解,超越了通过束搜索(标准解码方法)获得的近似模式,本文提出了多假设蒸馏(MHD),一种生成每个源句子多个翻译的序列级KD方法。这为学生模型提供了更大的教师模型分布表示,并使其暴露于更广泛的目标侧前缀。我们利用束搜索的n-best列表引导学生的学习,并检查其他解码方法以解决低变异性和稀有标记欠表示的问题。对于低资源语言,我们的研究表明,虽然采样方法在质量上略逊于基于束搜索的方法,但它们为生成的语料库带来了更大的变异性和词汇丰富性。这最终提高了学生模型的性能,并缓解了知识蒸馏常associated的性别偏置放大问题。

关键词

引用

@article{arxiv.2507.21568,
  title  = {Multi-Hypothesis Distillation of Multilingual Neural Translation Models for Low-Resource Languages},
  author = {Aarón Galiano-Jiménez and Juan Antonio Pérez-Ortiz and Felipe Sánchez-Martínez and Víctor M. Sánchez-Cartagena},
  journal= {arXiv preprint arXiv:2507.21568},
  year   = {2025}
}

备注

17 pages, 12 figures