从头训练面向哈萨克语的高效小型语言模型 SozKZ
计算与语言
2026-03-24 v1 人工智能
摘要
哈萨克语是一门 spoken by 超过2200万人的 Turc 语, 仍未得到现有多语言语言模型的充分关注, 这些模型为低资源语言分配最小容量且采用不适用于屈从形态学的分词器。我们提出SozKZ, 一套基于 Llama 架构的语言模型(参数量50M-600M), 完全基于 90亿token哈萨克文本从头训练, 并配备專为哈萨克语设计的 50K BPE 分词器。我们在三个哈萨克语基准任务上评估所有模型——多选文化问答、阅读理解(Belebele)和主题分类(SIB-200)——以及五个多语言基准(参数量500M至3B)。我们的600M模型在哈萨克语文化问答上达到30.3%准确率, 接近 Llama-3.2-1B(规模是2倍)的32.0%, 并在 SIB-200 主题分类中取得25.5%准确率, 超越所有评估的多语言模型(最高达2B参数)。我们观察到从50M到600M的模型规模提升始终伴随性能提升, 多选问答准确率从22.8%提升至30.3%, 这表明进一步扩大规模仍有益。这些结果表明, 小规模专为特定语言训练的模型, 配合语言适合的分词器, 可为低资源语言技术提供可行路径, 在计算成本占比更小的情况下实现竞争性能。所有模型及分词器均在开放许可下发布。
引用
@article{arxiv.2603.20854,
title = {SozKZ: Training Efficient Small Language Models for Kazakh from Scratch},
author = {Saken Tukenov},
journal= {arXiv preprint arXiv:2603.20854},
year = {2026}
}
备注
12 pages, 3 figures, 2 tables