Vikhr:面向俄语的开源指令微调大语言模型系列
计算与语言
2026-02-17 v7 人工智能
摘要
各种大语言模型(LLM)的开发出现了激增。然而,英语以外语言的文本生成常常面临重大挑战,包括生成质量差和由于模型词汇表中标记表示比例失调导致的计算性能下降。在这项工作中,我们通过开发一个将面向英语的预训练模型适应其他语言的流水线,并构建高效的双语LLM来解决这些问题。利用该流水线,我们构建了Vikhr,一系列专为俄语设计的双语开源指令遵循LLM。“Vikhr”指的是Mistral LLM系列的名称,意为“一阵强风”。与以往通常依赖面向英语模型之上的LoRA适配器、以牺牲性能换取较低训练成本的俄语模型不同,Vikhr具有适应后的分词器词汇表,并对所有权重进行持续预训练和指令微调。这不仅增强了模型性能,还显著提高了其计算和上下文效率。我们还扩展了指令数据集和用于持续预训练的语料库。模型权重、指令集和代码均已公开。
引用
@article{arxiv.2405.13929,
title = {Vikhr: The Family of Open-Source Instruction-Tuned Large Language Models for Russian},
author = {Aleksandr Nikolich and Konstantin Korolev and Sergei Bratchikov and Igor Kiselev and Artem Shelmanov},
journal= {arXiv preprint arXiv:2405.13929},
year = {2026}
}