中文

ThinkTuning:无需蒸馏的认知反思注入方法

人工智能 2025-08-22 v2 计算与语言 机器学习

摘要

测试时扩展的最新进展催生了展现出自我反思行为和多步推理能力的思考型大语言模型(LLM)。虽然强化学习(RL)驱动了这种自我改进范式,但最近的一项研究(Gandhi 等人,2025)表明,仅靠 RL 并不能真正注入这些新的推理能力——它只是引出了基础模型中已存在的行为。这提出了一个问题:我们如何训练那些未表现出此类思考行为的模型,使其首先发展出这种能力?为此,我们提出了 ThinkTuning,这是一种基于 GRPO 的交互式训练方法,我们通过教师模型的指导来增强学生模型的生成轨迹。我们的方法灵感来源于课堂实践中的一个简单想法:教师提出一个问题,让学生尝试回答,然后给出纠正性反馈——足以将思维引向正确方向,然后展示解决方案。每一次反馈都会重塑学生的思维,引导他们得出正确的解决方案。同样,我们发现,通过来自同等规模教师模型的反馈进行这种类型的隐式监督,可以提高学生模型的推理能力。具体而言,在各项基准测试中,我们的方法平均比零样本基线提高了 3.85%,在 MATH-500、AIME 和 GPQA-Diamond 上,分别比 vanilla-GRPO 基线提高了 2.08%、2.23% 和 3.99%。源代码可在 https://github.com/3rdAT/ThinkTuning 获取。

关键词

引用

@article{arxiv.2508.07616,
  title  = {ThinkTuning: Instilling Cognitive Reflections without Distillation},
  author = {Aswin RRV and Jacob Dineen and Divij Handa and Md Nayem Uddin and Mihir Parmar and Chitta Baral and Ben Zhou},
  journal= {arXiv preprint arXiv:2508.07616},
  year   = {2025}
}

备注

EMNLP 2025 (Main Conference)