中文

保持好奇心的学习:基于自适应自蒸馈的熵保持监督微调方法用于大规模推理模型

机器学习 2026-02-10 v2 计算与语言

摘要

大规模推理模型的标准后训练流程(监督微调后强化学习,SFT-then-RL)可能限制RL阶段的潜在收益:虽然SFT模仿专家演示,但常导致过度自信,降低生成多样性,使RL在受限的解空间中探索。训练时添加熵正则化并非万能解,容易使词令分布趋于均匀,增加熵却未提高有意义的探索能力。本文提出CurioSFT——一种旨在通过内在好奇心增强探索能力的熵保持SFT方法,包含(a)自探索蒸馏,利用自生成、温度缩放的教师模型鼓励模型在自身能力范围内探索;以及(b)熵导引温度选择,自适应调整蒸馏强度,通过放大推理令的探索性而稳定事实令的记忆,缓解知识遗忘。在数学推理任务上的大规模实验表明,CurioSFT在SFT阶段在分布内任务上比基础SFT提升2.5分,在分布外任务上提升2.9分。我们也验证了SFT期间保存的探索能力成功转化为RL阶段的实际收益,平均提升5.0分。

关键词

引用

@article{arxiv.2602.02244,
  title  = {Learning While Staying Curious: Entropy-Preserving Supervised Fine-Tuning via Adaptive Self-Distillation for Large Reasoning Models},
  author = {Hao Wang and Hao Gu and Hongming Piao and Kaixiong Gong and Yuxiao Ye and Xiangyu Yue and Sirui Han and Yike Guo and Dapeng Wu},
  journal= {arXiv preprint arXiv:2602.02244},
  year   = {2026}
}