TinyThinker:通过自省实现粗到细知识内在化的推理蒸馏
计算与语言
2025-02-05 v2
摘要
大型语言模型在各种任务中展现出惊人的推理能力,推动了通过生成推理数据将这些能力蒸馏到小型模型的努力。然而,直接在此类合成推理数据上训练可能导致对推理过程的浅层模仿,而非促进推理能力与底层知识的真正融合。为此,我们提出TinyThinker框架,引入两种新方法。首先,我们引入三个阶段的过程,逐步引导学生模型通过推理过程,从粗到细 progressively细化知识。其次,我们开发了两阶段训练框架,包括初始的推理获取阶段和后续的自省阶段。实验在常识推理基准测试上表明,TinyThinker在各项基准测试中优于基线方法。消融研究进一步验证了框架中各组件的有效性。我们预计TinyThinker可扩展到其他知识密集型推理任务,为开发小型语言模型的有效推理能力提供一种替代策略。代码已公开于https://github.com/shengminp/TinyThinker。
引用
@article{arxiv.2412.08024,
title = {TinyThinker: Distilling Reasoning through Coarse-to-Fine Knowledge Internalization with Self-Reflection},
author = {Shengmin Piao and Sanghyun Park},
journal= {arXiv preprint arXiv:2412.08024},
year = {2025}
}
备注
Accepted by NAACL 2025 Main Conference