中文

SkillFactory:用于学习认知行为的自蒸馏

计算与语言 2026-04-13 v2 人工智能

摘要

利用长链思考的推理模型会运用各种认知技能,如验证答案、回溯、通过另一种方法重试等。先前的工作表明,当基础语言模型 exhibits 这些技能时,使用强化学习 (RL) 对该模型进行进一步训练可以学习利用这些技能。我们如何获取模型利用那些基础模型未展现的技能?我们的工作 SkillFactory 是一种在 RL 之前通过监督式微调 (SFT) 阶段大致学习这些技能的方法。我们的做法不依赖来自更强模型的蒸馏,而是使用来自模型本身的样本,重新排列以以这些技能的格式提供训练数据。这些“银色”SFT 轨迹可能不完美,但仍然有效,可用于在 RL 期间引导模型获取技能。我们的评估显示:(1)尽管训练前性能较低,基于 SkillFactory SFT 初始化的模型在 RL 后能泛化到更难的任务变体;(2)认知技能确实被模型所使用;(3)使用 RL 训练的 SkillFactory 模型在域外任务上的回归鲁棒性更好。我们的工作表明,RL 之前学习的归纳偏差有助于模型学习可靠的认知技能使用。

关键词

引用

@article{arxiv.2512.04072,
  title  = {SkillFactory: Self-Distillation For Learning Cognitive Behaviors},
  author = {Zayne Sprague and Jack Lu and Manya Wadhwa and Sedrick Keh and Mengye Ren and Greg Durrett},
  journal= {arXiv preprint arXiv:2512.04072},
  year   = {2026}
}

备注

Published at ICLR 2026; code at https://github.com/Zayne-sprague/SkillFactory