并非所有正确答案都同等重要:为何蒸馏来源至关重要
计算与语言
2025-05-23 v2
摘要
蒸馏已成为增强开源语言模型推理能力的一种实用且有效的方法。在本工作中,我们通过收集三个 SOTA 教师模型——AM-Thinking-v1、Qwen3-235B-A22B 和 DeepSeek-R1——在包含 189 万个查询的共享语料库上的已验证输出,对推理数据蒸馏进行了大规模实证研究。我们构建了三个平行数据集并分析了它们的分布,结果表明 AM-Thinking-v1 蒸馏出的数据展现出更大的 token 长度多样性和更低的困惑度。在每个数据集上训练的学生模型在包括 AIME2024、AIME2025、MATH500 和 LiveCodeBench 在内的推理基准上进行了评估。源自 AM-Thinking-v1 的蒸馏模型持续取得最佳性能(例如,AIME2024 上 84.3,AIME2025 上 72.2,MATH500 上 98.4,LiveCodeBench 上 65.9),并展现出自适应的输出行为——对于较难的任务生成更长的回复,对于较简单的任务生成较短的回复。这些发现凸显了高质量、已验证推理轨迹的价值。我们发布了 AM-Thinking-v1 和 Qwen3-235B-A22B 的蒸馏数据集,以支持未来对开放且高性能的推理导向语言模型的研究。这些数据集已在 Hugging Face 上公开。
引用
@article{arxiv.2505.14464,
title = {Not All Correct Answers Are Equal: Why Your Distillation Source Matters},
author = {Xiaoyu Tian and Yunjie Ji and Haotian Wang and Shuaiting Chen and Sitong Zhao and Yiping Peng and Han Zhao and Xiangang Li},
journal= {arXiv preprint arXiv:2505.14464},
year = {2025}
}