中文

比利克7B v0.1:波兰语言模型——开发、洞见与评估

计算与语言 2026-01-01 v2 人工智能

摘要

我们介绍Bielik 7B v0.1,这是一个用于波兰语言处理的70亿参数生成式文本模型。该模型在精选的波兰语语料库上进行训练,通过创新技术解决了语言模型开发中的关键挑战。这些包括加权指令交叉熵损失(Weighted Instruction Cross-Entropy Loss),它平衡了不同指令类型的学习;以及自适应学习率(Adaptive Learning Rate),它根据训练进度动态调整学习率。为了评估性能,我们创建了Open PL LLM Leaderboard和Polish MT-Bench两个新框架,用于评估各种NLP任务和对话能力。Bielik 7B v0.1在RAG Reader任务上的平均得分比Mistral-7B-v0.1提高了9个百分点。它在Polish MT-Bench中表现突出,尤其是在推理(6.15/10)和角色扮演(7.83/10)类别中。该模型代表了波兰语言AI领域的重大进展,为 diverse 语言应用提供了强大工具,并在该领域树立了新的基准。

关键词

引用

@article{arxiv.2410.18565,
  title  = {Bielik 7B v0.1: A Polish Language Model -- Development, Insights, and Evaluation},
  author = {Krzysztof Ociepa and Łukasz Flis and Krzysztof Wróbel and Adrian Gwoździej and Remigiusz Kinas},
  journal= {arXiv preprint arXiv:2410.18565},
  year   = {2026}
}