MiCoTA:通过中等长度 CoT 与教师助手桥接可学习性鸿沟
计算与语言
2025-07-03 v1
摘要
大型语言模型(LLMs)在需要长思考序列进行计划、反思与 refinement 的推理任务中表现突出。然而其巨大模型规模与高计算需求不利于广泛部署。小型语言模型(SLMs)常因容量有限难以学习长形式 CoT 推理,我们称之为 "SLMs Learnability Gap"。为此,我们提出 Mid-CoT Teacher Assistant Distillation(MiCoTA)框架,以提高 SLMs 的长 CoT 蒸馏效果。MiCoTA 采用中等规模模型作为 teacher assistant,运用中等长度 CoT 序列桥接 capacity 与 reasoning length 之间的鸿沟。我们的实验表明,尽管直接从 large teacher 蒸馏的 SLMs 表现不佳,但经 MiCoTA 后可显著提升推理性能。具体而言,Qwen2.5-7B-Instruct 与 Qwen2.5-3B-Instruct 在 AIME2024、AMC、Olympiad、MATH-500 与 GSM8K 等 benchmark 上平均提升分别达 3.47 与 3.93 分。为探究 MiCoTA 机制,我们进行量化实验表明该方法生成的数据更贴合 base SLM 分布。我们的洞见为 SLMs 的长 CoT 数据蒸馏研究指明了道路。
引用
@article{arxiv.2507.01887,
title = {MiCoTA: Bridging the Learnability Gap with Intermediate CoT and Teacher Assistants},
author = {Dongyi Ding and Tiannan Wang and Chenghao Zhu and Meiling Tao and Yuchen Eleanor Jiang and Wangchunshu Zhou},
journal= {arXiv preprint arXiv:2507.01887},
year = {2025}
}
备注
Work in progress