增长与合并:高效语言适应的扩展策略
计算与语言
2025-12-12 v1 人工智能
机器学习
摘要
实现高性能包含中低资源语言的语言模型仍是一个挑战。大规模多语言模型在小规模模型下仍不如语言特定适应。本文我们探讨了将预训练模型扩展到新目标语言的扩展策略。通过进行约为 FLOP 匹配的模型进行全面扩展消检验,我们测试了放大英文基座模型是否比标准继续预训练更有效且更高效地适应。我们发现,只要接触到足够的目标语言数据,更大的放大模型即可匹配或超越在大量数据上继续预训练的较小模型,显示现扩展对数据效率的益处。扩展还有助于保留基座模型的英文能力,从而减少灾难性遗忘。最后,我们探讨了这些规模化、语言特定模型是否可以合并以构建模块化和灵活的多语言系统。我们发现,尽管合并仍不如联合多语言训练有效,但放大的合并优于较小的合并。我们观察到不同合并方法之间存在显著的性能差异,表明通过针对语言级别集成的合并方法有望取得改进。
引用
@article{arxiv.2512.10772,
title = {Grow Up and Merge: Scaling Strategies for Efficient Language Adaptation},
author = {Kevin Glocker and Kätriin Kukk and Romina Oji and Marcel Bollmann and Marco Kuhlmann and Jenny Kunz},
journal= {arXiv preprint arXiv:2512.10772},
year = {2025}
}