Bielik-Minitron-7B:通过结构化剪枝和知识蒸馏压缩面向波兰语的大语言模型
计算与语言
2026-03-13 v1 人工智能
摘要
本报告详细阐述了 Bielik-Minitron-7B 的创建过程,这是一个针对欧洲语言优化的 7.35B 参数版本模型,源自 Bielik-11B-v3.0 模型。我们采用受 NVIDIA Minitron 方法启发的两阶段压缩方法,结合结构化混合剪枝和知识蒸馏,将模型参数数量减少 33.4%,从 11.04B 降至 7.35B。我们利用 NVIDIA Model Optimizer 进行结构化剪枝,并使用 NVIDIA NeMo 框架进行基于 logits 的蒸馏以恢复质量。蒸馏后,模型经历了严格的对齐流程,包括监督微调(SFT)、直接偏好优化(DPO-P)以及强化学习(GRPO)。我们的最终模型成功恢复了约 90% 的基线模型性能,同时提供了最高可达 50% 的推理加速。该方法展示了一种高效创建少数语言语言模型的途径,在保持原始模型质量的同时,显著降低了推理部署成本。
引用
@article{arxiv.2603.11881,
title = {Bielik-Minitron-7B: Compressing Large Language Models via Structured Pruning and Knowledge Distillation for the Polish Language},
author = {Remigiusz Kinas and Paweł Kiszczak and Sergio P. Perez and Krzysztof Ociepa and Łukasz Flis and Krzysztof Wróbel and Adrian Gwoździej},
journal= {arXiv preprint arXiv:2603.11881},
year = {2026}
}