中文

TinyR1-32B-Preview:通过分支合并蒸馏提升准确率

计算与语言 2026-04-30 v3 人工智能

摘要

在保持性能的同时减小大型语言模型(LLM)规模的挑战已受到广泛关注。然而,现有方法如模型蒸馏和迁移学习往往难以达到高精度。为解决这一局限,我们提出分支合并蒸馏方法,通过两个阶段增强模型压缩:(1)分支阶段,通过领域特定的监督微调(SFT)将大型教师模型的知识选择性蒸馏到专门的学生模型中;(2)合并阶段,将这些学生模型合并以实现跨领域知识迁移并提升泛化能力。我们使用DeepSeek-R1作为教师模型、DeepSeek-R1-Distill-Qwen-32B作为学生模型来验证该蒸馏方法。生成的合并模型TinyR1-32B-Preview在多个基准测试中优于其对应模型DeepSeek-R1-Distill-Qwen-32B,包括数学(+5.5分)、编程(+4.4分)和科学(+2.9分),同时在AIME 2024上达到与DeepSeek-R1接近相当的性能。分支合并蒸馏方法为创建更小、高性能的LLM提供了可扩展的解决方案,降低了计算成本和时间。

关键词

引用

@article{arxiv.2503.04872,
  title  = {TinyR1-32B-Preview: Boosting Accuracy with Branch-Merge Distillation},
  author = {Lin Sun and Guangxiang Zhao and Xiaoqi Jian and Yuhan Wu and Weihong Lin and Yongfu Zhu and Qilong Shi and Change Jia and Aomufei Yuan and Yuxuan Tian and Linglin Zhang and Jinzhu Wu and Junfeng Ran and Sai-er Hu and Zihan Jiang and Junting Zhou and Wenrui Liu and Xusen Xiao and Bin Cui and Tong Yang and Xiangzheng Zhang},
  journal= {arXiv preprint arXiv:2503.04872},
  year   = {2026}
}

备注

Preprint