SCoder:用于引导小规模数据合成器以赋能代码 LLM 的迭代自蒸馏
人工智能
2025-09-10 v1
摘要
现有的编码大语言模型 (LLM) 通常依赖从专有 LLM 提炼的大规模指令数据进行微调,这通常造成高昂的成本。本文我们探索了小规模开源 LLM(例如 7B)作为高质量代码指令数据构建合成器的潜力。我们首先观察到,小规模 LLM 的数据合成能力可以通过在少数优质数据合成样本上训练来增强。基于此,我们提出了一种新颖的迭代自蒸馏方法,以引导小规模 LLM,将其转化为强大的合成器,以减少对专有 LLM 的依赖并最小化成本。具体而言,在每次迭代中,为获得多样且高质量的自蒸馏数据,我们设计了多-checkpoint 采样和多方面评分策略进行初始数据选择。此外,为识别最具影响力的样本,我们引入了基于梯度的影响估计方法进行最终数据筛选。基于小规模合成器生成的代码指令数据集,我们开发了 SCoder,一套从 DeepSeek-Coder 微调的编码生成模型。SCoder 模型实现了代码生成的先进能力,证明了我们方法的有效性。
关键词
引用
@article{arxiv.2509.07858,
title = {SCoder: Iterative Self-Distillation for Bootstrapping Small-Scale Data Synthesizers to Empower Code LLMs},
author = {Xinyu Zhang and Changzhi Zhou and Linmei Hu and Luhao Zhang and Xiancai Chen and Haomin Fu and Yang Yang and Mengdi Zhang},
journal= {arXiv preprint arXiv:2509.07858},
year = {2025}
}