中文

从非对齐到对齐:基于多向平行语料库的多语言大语言模型扩展

计算与语言 2025-10-22 v4 人工智能

摘要

大规模多语言数据的持续预训练和指令调优已被证明是扩展大语言模型(LLM)至低资源语言的有效方法。然而,此类数据的非对齐性质限制了其有效捕捉跨语言语义的能力。相比之下,多向平行数据(identical content跨语言对齐)提供了更强的跨语言一致性,具有更大的提升多语言性能潜力。本文介绍了基于 TED 演讲构建的大规模高质量多向平行语料库 TED2025。该语料库覆盖 113 种语言,最多可实现 50 种语言的平行对齐,确保了广泛的多语言覆盖。利用该数据集,我们探讨了利用多向平行数据提升 LLM 的最佳实践,包括持续预训练、指令调优策略以及关键影响因素的分析。六个多语言基准实验表明,基于多向平行数据训练的模型始终优于基于非对齐多语言数据的模型。

关键词

引用

@article{arxiv.2505.14045,
  title  = {From Unaligned to Aligned: Scaling Multilingual LLMs with Multi-Way Parallel Corpora},
  author = {Yingli Shen and Wen Lai and Shuo Wang and Ge Gao and Kangyang Luo and Alexander Fraser and Maosong Sun},
  journal= {arXiv preprint arXiv:2505.14045},
  year   = {2025}
}

备注

EMNLP 2025 Main Conference (Oral)