通过Bielik v3 7B和11B系列中的分词器优化推进波兰语语言建模
计算与语言
2026-04-14 v1 人工智能
摘要
Bielik v3 PL系列的开发,涵盖了7B和11B参数变体,代表了语言特定大语言模型(LLM)优化领域的一个重要里程碑。虽然通用模型通常展现出令人印象深刻的多语言能力,但它们常常遭受一个根本性的架构效率低下问题:使用通用分词器。这些分词器通常设计用于覆盖广泛的语言谱系,往往无法捕捉到像波兰语这样的特定语言的形态学细微差别,导致更高的生育率、增加的推理成本和受限的有效上下文窗口。本报告详细阐述了从基于Mistral的通用分词到为Bielik v3模型定制的波兰语优化词汇表的转变过程,探讨了基于FOCUS的嵌入初始化、多阶段预训练课程,以及随后的后训练对齐,包括监督微调(Supervised Fine-Tuning)、直接偏好优化(Direct Preference Optimization)和通过带可验证奖励的群组相对策略优化(Group Relative Policy Optimization)进行的强化学习。
引用
@article{arxiv.2604.10799,
title = {Advancing Polish Language Modeling through Tokenizer Optimization in the Bielik v3 7B and 11B Series},
author = {Krzysztof Ociepa and Łukasz Flis and Remigiusz Kinas and Krzysztof Wróbel and Adrian Gwoździej},
journal= {arXiv preprint arXiv:2604.10799},
year = {2026}
}
备注
arXiv admin note: text overlap with arXiv:2601.11579