中文

SemiAdapt 与 SemiLoRA:面向低资源语言翻译的高效领域适配——以爱尔兰语为案例

计算与语言 2025-10-22 v1

摘要

微调是为特定任务如神经机器翻译 (NMT) 定制大型语言模型的常用方法。然而,在拥有数十亿参数的大型多语言模型上进行微调会带来巨大的计算成本,这成为研究者在低资源领域(如爱尔兰语翻译)进入该领域的障碍。参数高效微调 (PEFT) 借助低秩适配 (LoRA) 方法引入小型可训练适配层,训练仅需原始模型参数的一小部分,从而弥合了这一差距。我们引入 SemiAdapt 与 SemiLoRA 两种半监督推理高效方法,以强化领域适配并实现整体性能提升。我们展示 SemiAdapt 能够超越全域微调,而最值得注意的是 SemiLoRA 能够将 PEFT 方法提升至与完全微调持平甚至更优。我们进一步评估了按领域-数据集微调的情况,证明基于嵌入的推理方法在大型且噪声较大的语料库上表现尤为出色。本文开发的所有爱尔兰语翻译模型均以开放资源形式发布。这些方法旨在使低资源语言的高质量领域适配与微调更加可及。

关键词

引用

@article{arxiv.2510.18725,
  title  = {SemiAdapt and SemiLoRA: Efficient Domain Adaptation for Transformer-based Low-Resource Language Translation with a Case Study on Irish},
  author = {Josh McGiff and Nikola S. Nikolov},
  journal= {arXiv preprint arXiv:2510.18725},
  year   = {2025}
}

备注

8 pages