利用多语言编码器和知识蒸馏增强低资源神经机器翻译:一项案例研究
计算与语言
2024-07-10 v1
摘要
神经机器翻译(NMT)仍然是一项艰巨的挑战,尤其是在处理低资源语言时。预训练的序列到序列(seq2seq)多语言模型,例如 mBART-50,已在各种低资源 NMT 任务中展现出令人印象深刻的性能。然而,它们的预训练仅限于 50 种语言,无法支持众多低资源语言,特别是那些在印度次大陆使用的语言。扩展 mBART-50 的语言支持需要复杂的预训练,并存在因灾难性遗忘而导致性能下降的风险。考虑到这些扩展挑战,本文探索了一个框架,该框架利用预训练语言模型和知识蒸馏的优势,在 seq2seq 架构中促进低资源语言(包括 mBART-50 未覆盖的语言)的翻译。所提出的框架采用基于多语言编码器的 seq2seq 模型作为基础架构,随后使用互补的知识蒸馏技术来减轻训练不平衡的影响。我们的框架在三种低资源印度语言上,针对四种印度语到印度语的翻译方向进行了评估,在 BLEU-4 和 chrF 指标上相比基线取得了显著提升。此外,我们进行了人工评估以确认我们方法的有效性。我们的代码公开在 https://github.com/raypretam/Two-step-low-res-NMT。
引用
@article{arxiv.2407.06538,
title = {Enhancing Low-Resource NMT with a Multilingual Encoder and Knowledge Distillation: A Case Study},
author = {Aniruddha Roy and Pretam Ray and Ayush Maheshwari and Sudeshna Sarkar and Pawan Goyal},
journal= {arXiv preprint arXiv:2407.06538},
year = {2024}
}
备注
Published at Seventh LoResMT Workshop at ACL 2024