中文

跨语言映射:预训练中的跨语言对齐及其对多语言 LLM 性能的提升

计算与语言 2026-04-14 v1 人工智能

摘要

多语言大型语言模型(LLM)在跨语言任务中表现不佳,这源于高资源语言与低资源语言之间的数据不平衡,以及预训练中的单语言偏差。现有方法,如双语微调和对比对齐,虽可提升跨语言性能,但往往需要大量平行数据或存在不稳定性。为此,我们在预训练阶段引入跨语言映射任务,无需牺牲单语言流畅性即可提升跨语言对齐。我们的做法在 LLM 嵌入空间中双向映射语言,改善语言生成和理解能力。我们进一步提出了语言对齐系数,以在数据有限的场景中稳健地量化跨语言一致性。实验在机器翻译(MT)、跨语言自然语言理解(CLNLU)和跨语言问答(CLQA)上显示,我们的模型在 MT 上可提升最高达 11.9 BLEU 分,在 CLQA BERTScore-Precision 上提升 6.72 分,在 CLNLU 准确率上提升超过 5%。这些结果凸显了将跨语言目标纳入预训练以提升多语言 LLM 性能的潜力。

关键词

引用

@article{arxiv.2604.10590,
  title  = {Bridging Linguistic Gaps: Cross-Lingual Mapping in Pre-Training and Dataset for Enhanced Multilingual LLM Performance},
  author = {Weihua Zheng and Chang Liu and Zhengyuan Liu and Xin Huang and Kui Wu and Muhammad Huzaifah Md Shahrin and Aiti Aw and Roy Ka-Wei Lee},
  journal= {arXiv preprint arXiv:2604.10590},
  year   = {2026}
}