Bielik v3 Small:技术报告
机器学习
2025-05-12 v2 人工智能
计算与语言
摘要
我们介绍了 Bielik v3,一系列针对波兰语处理优化的参数高效生成式文本模型(1.5B 和 4.5B)。这些模型表明,更小、优化良好的架构可以在显著减少计算资源需求的同时,达到与更大模型相当的性能。我们的方法融合了几项关键创新:一个定制的波兰语分词器(APT4),显著提高了分词效率;加权指令交叉熵损失,用于平衡不同指令类型的学习;以及自适应学习率,根据训练进度动态调整。这些模型在一个精心构建的、包含 2920 亿个词元、涵盖 3.03 亿份文档的语料库上训练,在多个基准测试中表现优异,包括 Open PL LLM 排行榜、复杂波兰语文本理解基准、波兰语 EQ-Bench 和波兰语医学排行榜。4.5B 参数模型取得了与 2-3 倍于其规模的模型相竞争的结果,而 1.5B 参数模型尽管体积极其紧凑,仍提供了强大的性能。这些进展为低资源语言的参数高效语言建模设立了新基准,使高质量波兰语 AI 在资源受限的应用中更易获取。
引用
@article{arxiv.2505.02550,
title = {Bielik v3 Small: Technical Report},
author = {Krzysztof Ociepa and Łukasz Flis and Remigiusz Kinas and Krzysztof Wróbel and Adrian Gwoździej},
journal= {arXiv preprint arXiv:2505.02550},
year = {2025}
}