探索蒸馏推理模型:一种表征方法
机器学习
2025-03-26 v2
摘要
在本论文中,我们研究了模型蒸馏对大型语言模型(LLM)中推理特征开发的影响。为探索此问题,我们在Qwen系列模型及其微调变体上训练了一个交叉编码器。我们的结果表明,交叉编码器学习到对应各种类型推理特征的特征,包括自我反思和计算验证。此外,我们观察到蒸馏模型包含独特的推理特征方向,这些特征可用于引导模型进入过度思考或简明思考模式。特别是,我们对四种具体的推理类别进行分析:(a)自我反思,(b)演绎推理,(c)替代推理,和(d)对比推理。最后,我们检查了蒸馏过程导致特征几何变化,并发现更大的蒸馏模型可能发展出更结构化的表征,这与改进的蒸馏性能相关。通过提供有关蒸馏如何修改模型的见解,本研究为增强AI系统的透明度和可靠性作出了贡献。
引用
@article{arxiv.2503.03730,
title = {Towards Understanding Distilled Reasoning Models: A Representational Approach},
author = {David D. Baek and Max Tegmark},
journal= {arXiv preprint arXiv:2503.03730},
year = {2025}
}
备注
13 pages, 9 figures