面向语言适配的大语言模型在持续预训练下的涌现能力
计算与语言
2025-09-22 v3 人工智能
摘要
持续预训练 (CPT) 是将现有大语言模型 (LLM) 适配到新语言的一种常用方法。在此过程中,在混合数据中包含一部分英文数据是常见做法,但其作用至今尚未得到仔细研究。本文表明,包含英文数据不会影响验证困惑度,但对于目标语言下游能力的涌现至关重要。我们引入了一个与语言无关的上下文学习 (ICL) 基准测试,揭示了在不包含英文数据时 CPT 早期出现的灾难性遗忘。这进而损害了模型泛化到目标语言下游提示词的能力(以困惑度衡量),即使这种损害在训练后期才在准确率上表现出来,并且可能与模型参数的巨大偏移有关。基于这些见解,我们引入了课程学习和权重指数移动平均 (EMA) 作为缓解对英文数据需求的有效替代方案。总而言之,本文阐明了在进行语言适配的 CPT 时涌现能力产生的动态机制,并可作为未来设计更有效方法的基础。
引用
@article{arxiv.2506.00288,
title = {Emergent Abilities of Large Language Models under Continued Pretraining for Language Adaptation},
author = {Ahmed Elhady and Eneko Agirre and Mikel Artetxe},
journal= {arXiv preprint arXiv:2506.00288},
year = {2025}
}
备注
Published as a Conference Paper at the main track of ACL 2025