中文

SRFT:一种基于监督和强化微调的单阶段推理方法

计算与语言 2025-06-25 v1 人工智能 机器学习

摘要

大型语言模型(LLM)在推理任务中取得了显著进展,但LLM监督微调(SFT)和强化学习(RL)的最佳集成方式仍是根本性挑战。通过从熵的视角对token分布、学习动力学和集成机制进行全面分析,我们揭示了这些范式之间的关键差异:SFT对LLM策略分布引起粗粒度的全局性变更,而RL执行细粒度的选择性优化,熵作为训练有效性的关键指示器。基于这些观察,我们提出了监督强化微调(SRFT),一种通过熵感知加权机制统一两种微调范式的单阶段方法。我们的方案同时应用SFT和RL,直接优化LLM使用演示和自我探索 rollout,而非通过两阶段顺序方法。大量实验表明,SRFT在五个数学推理基准测试中实现了59.1%的平均准确率,相较于零RL方法在数学推理基准测试中提升9.0%,在三个分布外基准测试中提升10.9%。

关键词

引用

@article{arxiv.2506.19767,
  title  = {SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning},
  author = {Yuqian Fu and Tinghong Chen and Jiajun Chai and Xihuai Wang and Songjun Tu and Guojun Yin and Wei Lin and Qichao Zhang and Yuanheng Zhu and Dongbin Zhao},
  journal= {arXiv preprint arXiv:2506.19767},
  year   = {2025}
}