基于监督奖励的强化学习在指令跟随方面优于SFT
计算与语言
2025-10-17 v1
摘要
在大型语言模型的预训练阶段后,SFT、RLHF、RLVR 和 RFT 等技术被用于增强指令跟随能力、缓解不良响应、提高推理能力并以最小数据量实现高效的领域适应。SFT 依赖于下一个标记预测目标,使用大量人工标注响应的数据来强化基础模型的指令跟随能力。相比之下,RFT 采用基于强化学习的方法,将微调后的推理模型适应到具有有限监督的特定领域。灵感来自 RFT,我们提出用 RLSR 替代 SFT,以在强化学习框架中利用广泛的 SFT 数据集,从而提高基础模型的指令跟随能力。在 RLSR 中,基础模型为每个提示生成多个响应,并将生成响应与人工标注响应之间的语义嵌入空间中的余弦相似度计算为奖励得分。RLSR 可以以多种方式使用。它可以直接取代 SFT,在指令跟随基准测试中实现更好的性能;例如,RLSR (SB) 在 Qwen-7B (INFINITY) 上的 AlpacaEval 获胜率为 26.34%,超过 SFT 的 21.01%。此外,结合 SFT 和 RLSR 进一步提高了下游任务性能;Qwen-7B (INFINITY) 在训练 SFT + RLSR 时获得了 30.73% 的获胜率。
引用
@article{arxiv.2510.14200,
title = {RLSR: Reinforcement Learning with Supervised Reward Outperforms SFT in Instruction Following},
author = {Zhichao Wang and Andy Wong and Ruslan Belkin},
journal= {arXiv preprint arXiv:2510.14200},
year = {2025}
}