Gamayun 之路:15 亿参数 LLM 的高效多语言训练
计算与语言
2025-12-30 v2
摘要
我们介绍 Gamayun,这是一个 15 亿参数的多语言语言模型,其完全从头在 2.5 万亿 token 上进行训练。Gamayun 旨在高效且可部署于资源受限环境,旨在解决小型非英语中心 LLM 研究不足的问题,通过采用一种新颖的两阶段预训练策略:平衡的多语言训练用于跨语言对齐,随后进行高质量英文丰富以在语言之间传递性能提升。我们的模型支持 12 种语言,特别关注俄语。尽管训练预算显著低于类似模型,Gamayun 在所有考虑的基准测试中均优于 LLaMA3.2-1B(9 万亿 token),并在广泛的英文和多语言任务中超越 Qwen2.5-1.5B(18 万亿 token)。在大多数任务(除高级 STEM 外)上与 Qwen3(36 万亿 token)持平或更好,实现了在俄语中的最先进结果,包括 MERA 基准测试,在参数规模为 1-20 亿的模型中实现最佳效果。
引用
@article{arxiv.2512.21580,
title = {Gamayun's Path to Multilingual Mastery: Cost-Efficient Training of a 1.5B-Parameter LLM},
author = {Alexander Podolskiy and Semen Molokov and Timofey Gerasin and Maksim Titov and Alexey Rukhovich and Artem Khrapov and Kirill Morozov and Evgeny Tetin and Constantine Korikov and Pavel Efimov and Polina Lazukova and Yuliya Skripkar and Nikita Okhotnikov and Irina Piontkovskaya and Meng Xiaojun and Zou Xueyi and Zhang Zhenhe},
journal= {arXiv preprint arXiv:2512.21580},
year = {2025}
}