Bielik 11B v2 技术报告
计算与语言
2025-05-12 v2 人工智能
摘要
我们 presented Bielik 11B v2,这是一个针对波兰语文本处理优化的领先语言模型。基于 Mistral 7B v0.2 架构,采用深度扩展方式扩展至 110 亿参数,这个模型在波兰语基准测试中展现出卓越的性能,同时保持强大的跨语言能力。我们引入了两个关键技术创新:加权指令交叉熵损失(Weighted Instruction Cross-Entropy Loss),通过为训练示例分配基于质量的权重来优化跨 diverse instruction types 的学习;自适应学习率(Adaptive Learning Rate),根据上下文长度动态调整。针对多个基准进行全面评估显示,Bielik 11B v2 在许多更大模型(包括参数数目是其 2-6 倍的模型)中表现出色,显著优于其他专门的波兰语语言模型,在从语言理解到复杂推理的各种任务上都表现出色。该模型的参数效率和广泛量化选项使其能够在各种硬件配置上部署,推动了波兰语人工智能能力的发展,为资源有限的语言建模在较少代表性语言中树立了新的基准。
引用
@article{arxiv.2505.02410,
title = {Bielik 11B v2 Technical Report},
author = {Krzysztof Ociepa and Łukasz Flis and Krzysztof Wróbel and Adrian Gwoździej and Remigiusz Kinas},
journal= {arXiv preprint arXiv:2505.02410},
year = {2025}
}