中文

通过跨语言情境预训练提升LLM语言适应性

计算与语言 2025-09-22 v2

摘要

大型语言模型(LLM)尽管基于英语进行预训练,仍表现出惊人的多语言能力,这归因于预训练期间的跨语言机制。现有方法受限于平行资源,导致语言覆盖范围和领域覆盖范围有限。我们提出跨语言情境预训练(CrossIC-PT),一种简单且可扩展的方法,通过利用语义相关的双语文本进行简单的最近词预测来增强跨语言传输。我们通过将语义相关的双语维基百科文档交错组合到单个情境窗口中来构建CrossIC-PT样本。为解决窗口大小限制,我们实施一套系统化的分段策略,将较长的双语文档对分为块状,同时调整滑动窗口机制以保持情境连贯性。我们进一步通过语义检索框架扩展数据可获得性,以从网络爬虫语料库中构建CrossIC-PT样本。实验结果表明,CrossIC-PT在三个模型(Llama-3.1-8B、Qwen2.5-7B和Qwen2.5-1.5B)上的六种目标语言性能提升分别为3.79%、3.99%和1.95%,数据增强后进一步获得额外提升。

关键词

引用

@article{arxiv.2504.20484,
  title  = {Enhancing LLM Language Adaption through Cross-lingual In-Context Pre-training},
  author = {Linjuan Wu and Haoran Wei and Huan Lin and Tianhao Li and Baosong Yang and Fei Huang and Weiming Lu},
  journal= {arXiv preprint arXiv:2504.20484},
  year   = {2025}
}

备注

12 pages, 6 figures, EMNLP 2025