中文

SFT记忆,RL泛化:基础模型后训练的比较研究

人工智能 2025-05-27 v2 计算机视觉与模式识别 机器学习

摘要

监督微调(SFT)和强化学习(RL)是用于基础模型后训练的广泛应用技术,但其在增强模型泛化能力方面的作用尚不明确。本文聚焦于SFT和RL在泛化与记忆方面的差异,特别关注文本规则变体和视觉变体。我们引入GeneralPoints,一个算术推理卡牌游戏,采用V-IRL,一个真实世界导航环境,以评估使用SFT和RL训练的模型在文本和视觉域的未见变体上的泛化能力。我们表明,RL,特别是当以结果为基础的奖励进行训练时,能够在文本和视觉变体中实现广泛泛化。相比之下,SFT倾向于记忆训练数据,难以处理超出分布场景。进一步分析显示,RL提高了模型的底层视觉识别能力,促进了其在视觉域的增强泛化。尽管RL在泛化方面优于SFT,但我们表明SFT对于有效的RL训练仍至关重要;SFT稳定了模型的输出格式,使后续RL能够实现性能提升。这些发现表明了RL在复杂多模态任务中获取可泛化知识的能力。

关键词

引用

@article{arxiv.2501.17161,
  title  = {SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training},
  author = {Tianzhe Chu and Yuexiang Zhai and Jihan Yang and Shengbang Tong and Saining Xie and Dale Schuurmans and Quoc V. Le and Sergey Levine and Yi Ma},
  journal= {arXiv preprint arXiv:2501.17161},
  year   = {2025}
}

备注

Website at https://tianzhechu.com/SFTvsRL