中文

强化学习既非灵丹妙药也非幻象:理解监督学习与强化学习在大语言模型微调中的作用

机器学习 2025-08-25 v1 人工智能

摘要

从头开始训练大型语言模型(LLM)日益不切实际,使得监督微调(SFT)和强化学习微调(RL-FT,如PPO)等后训练方法成为现代实践的核心。我们使用一种超出分布(OOD)的24点卡牌游戏变体和新的频谱诊断工具,重新审视了这两个阶段如何重塑模型表示和OOD性能。我们的主要发现包括:(1)RL-FT可以恢复大量SFT导致的OOD性能损失(例如Llama-11B从8.97%提升至15.38%,Qwen-7B从17.09%提升至19.66%),但当SFT导致严重过拟合和明显分布偏移时,RL-FT无法完全恢复OOD性能。(2)奇异向量的方向位移比奇异值大小的位移更为重要。这些位移集中于与最大和最小奇异值相关的方向,同时保持整体谱保持不变。(3)低秩和浅层恢复有效:恢复前20%奇异值或前25%层的奇异向量方向可恢复70-80%的OOD性能。(4)更强的SFT检查点使RL能够实现更好的恢复,而过拟合的检查点则抵抗恢复。这些结果调和了之前关于RL在OOD性能方面优于监督学习的报告:RL主要是抵消SFT引起的方向漂移,而非寻找新解。我们的频谱感知分析突显了低秩UV合并和浅层层重置等廉价恢复杠杆,实践者可在低成本的RL微调之前使用。

关键词

引用

@article{arxiv.2508.16546,
  title  = {RL Is Neither a Panacea Nor a Mirage: Understanding Supervised vs. Reinforcement Learning Fine-Tuning for LLMs},
  author = {Hangzhan Jin and Sicheng Lv and Sifan Wu and Mohammad Hamdaqa},
  journal= {arXiv preprint arXiv:2508.16546},
  year   = {2025}
}