中文

用于文本图像机器翻译的多教师知识蒸馏

计算与语言 2023-05-11 v2

摘要

文本图像机器翻译(TIMT)已广泛应用于各种现实场景,其将图像中的源语言文本翻译为另一种目标语言句子。现有的 TIMT 方法主要分为两类:识别再翻译流水线模型与端到端模型。然而,如何将知识从流水线模型迁移到端到端模型仍是一个未解决的问题。本文提出一种新颖的多教师知识蒸馏(MTKD)方法,以有效地从流水线模型向端到端 TIMT 模型蒸馏知识。具体而言,利用三个教师来提升端到端 TIMT 模型的性能。端到端 TIMT 模型中的图像编码器在来自识别教师编码器的知识蒸馏指导下进行优化,而序列编码器与解码器则通过从翻译序列与解码教师模型迁移知识得以改进。此外,结合了词元级与句子级知识蒸馏,以更好地提升翻译性能。大量实验结果表明,我们提出的 MTKD 有效提升了文本图像翻译性能,并以更少的参数与更短的解码时间优于现有的端到端与流水线模型,说明 MTKD 能够兼取流水线与端到端模型之长。

关键词

引用

@article{arxiv.2305.05226,
  title  = {Multi-Teacher Knowledge Distillation For Text Image Machine Translation},
  author = {Cong Ma and Yaping Zhang and Mei Tu and Yang Zhao and Yu Zhou and Chengqing Zong},
  journal= {arXiv preprint arXiv:2305.05226},
  year   = {2023}
}

备注

Accepted at The 17th International Conference on Document Analysis and Recognition (ICDAR 2023)