探索多语言神经机器翻译微调中的内在语言特定子空间
计算与语言
2024-09-10 v1
摘要
多语言神经机器翻译模型支持同时微调数百种语言。然而,仅在全参数上进行微调效率低下,可能导致语言间的负面交互。在这项工作中,我们证明了一种语言的微调发生在其内在的语言特定子空间中,仅涉及全部参数的一小部分。因此,我们提出了语言特定的LoRA来隔离内在的语言特定子空间。此外,我们提出了架构学习技术,并在微调过程中引入渐进式剪枝调度,以详尽探索每种语言的最优设置和最小内在子空间,从而得到一个轻量级且有效的微调过程。在FLORES-101的12语言子集和30语言子集上的实验结果表明,我们的方法不仅在全参数微调基础上提升了高达2.25个spBLEU分数,还将高资源和中等资源语言的可训练参数减少到0.4%,低资源语言减少到1.6%。
引用
@article{arxiv.2409.05224,
title = {Exploring Intrinsic Language-specific Subspaces in Fine-tuning Multilingual Neural Machine Translation},
author = {Zhe Cao and Zhi Qu and Hidetaka Kamigaito and Taro Watanabe},
journal= {arXiv preprint arXiv:2409.05224},
year = {2024}
}