通过关键信息逐步注意力机制的混合层蒸馏提升小模型推理能力
计算与语言
2026-04-20 v1
摘要
大语言模型的巨大计算需求增加了通过思维链(CoT)蒸馏将推理能力迁移到小模型的兴趣。当前的 CoT 蒸馏方法主要侧重于将教师模型生成的复杂推理依据迁移给学生模型。然而,它们并未充分探索教师模型在推理过程中对关键信息的动态注意力。我们发现语言模型在推理过程中表现出对关键信息的逐步注意力转移,这暗示了得出结论的基本线索。基于这一观察和分析,我们引入了一种新颖的 CoT 蒸馏框架,该框架将教师模型对关键信息的逐步注意力迁移给学生模型。这为学生模型在推理过程中逐步聚焦关键信息建立了结构化指导。更重要的是,我们开发了一个混合层模块,能够实现适应教师模型和学生模型之间不同层的动态对齐。我们的方法在多个数学和常识推理数据集上取得了一致的性能提升。据我们所知,这是首个在 CoT 蒸馏中利用逐步注意力来提升小模型推理能力的方法。
引用
@article{arxiv.2604.15701,
title = {Improving Reasoning Capabilities in Small Models through Mixture-of-Layers Distillation with Stepwise Attention on Key Information},
author = {Yao Chen and Jiawei Sheng and Wenyuan Zhang and Tingwen Liu},
journal= {arXiv preprint arXiv:2604.15701},
year = {2026}
}
备注
Accepted at EMNLP 2025