GigaChat 系列:通过专家混合架构实现高效俄语建模
计算与语言
2025-06-12 v1 人工智能
摘要
生成式大语言模型(LLM)已成为现代 NLP 研究和多语言应用的关键工具。然而,专门针对俄语的基础模型开发一直受限,主要原因是所需的计算资源巨大。本文介绍了 GigaChat 系列俄语大语言模型,提供多种规模,包括基础模型和指令微调版本。我们提供了关于模型架构、预训练过程和实验的详细报告,以指导设计选择。此外,我们在俄语和英语基准上评估其性能,并将 GigaChat 与多语言同类模型进行比较。本文展示了通过 API、Telegram 机器人和 Web 界面访问的顶级模型的系统演示。此外,我们发布了三个开源 GigaChat 模型(https://huggingface.co/ai-sage),旨在扩展 NLP 研究机会并支持俄语工业解决方案的开发。
引用
@article{arxiv.2506.09440,
title = {GigaChat Family: Efficient Russian Language Modeling Through Mixture of Experts Architecture},
author = {GigaChat team and Mamedov Valentin and Evgenii Kosarev and Gregory Leleytner and Ilya Shchuckin and Valeriy Berezovskiy and Daniil Smirnov and Dmitry Kozlov and Sergei Averkiev and Lukyanenko Ivan and Aleksandr Proshunin and Ainur Israfilova and Ivan Baskov and Artem Chervyakov and Emil Shakirov and Mikhail Kolesov and Daria Khomich and Darya Latortseva and Sergei Porkhun and Yury Fedorov and Oleg Kutuzov and Polina Kudriavtseva and Sofiia Soldatova and Kolodin Egor and Stanislav Pyatkin and Dzmitry Menshykh and Grafov Sergei and Eldar Damirov and Karlov Vladimir and Ruslan Gaitukiev and Arkadiy Shatenov and Alena Fenogenova and Nikita Savushkin and Fedor Minkin},
journal= {arXiv preprint arXiv:2506.09440},
year = {2025}
}
备注
ACL-2025 System Demo