中文

多语言编码器比你想象的知道更多:极低资源语言的共享权重预训练

计算与语言 2025-05-30 v2 人工智能

摘要

尽管XLM-R等多语言语言模型推动了NLP中的多语言能力,但它们在极低资源语言上的表现仍然很差。这一情况因现代大语言模型(如LLaMA和Qwen)支持的语言远少于XLM-R而加剧,使得许多世界语言不存在文本生成模型。为应对这一挑战,我们提出了一种新颖的框架,用于将多语言编码器适配到极低资源语言的文本生成。通过复用编码器和解码器之间的权重,我们的框架使模型能够利用编码器学到的语义空间,在低资源语言中实现高效学习和有效泛化。将该框架应用于四种中国少数民族语言,我们提出了XLM-SWCM,并在各种下游任务上展示了其优越性能,即使与更大的模型相比也是如此。

关键词

引用

@article{arxiv.2502.10852,
  title  = {Multilingual Encoder Knows more than You Realize: Shared Weights Pretraining for Extremely Low-Resource Languages},
  author = {Zeli Su and Ziyin Zhang and Guixian Xu and Jianing Liu and XU Han and Ting Zhang and Yushuang Dong},
  journal= {arXiv preprint arXiv:2502.10852},
  year   = {2025}
}

备注

ACL 2025 camera-ready