SEIF:面向指令跟随的自演化强化学习
计算与语言
2026-05-11 v1
摘要
指令跟随是大型语言模型 (LLM) 的基本能力,但持续提升这一能力仍具有挑战性。现有方法通常依赖人类昂贵的外部监督或强大的教师模型,或采用难度静态的自我对弈训练,无法随模型能力提升而演化。为此,我们提出 SEIF(Self-Evolving Reinforcement Learning for Instruction Following),一个面向指令跟随的自演化框架。SEIF 构建一个闭合的自演化循环,在该循环中,指令难度演化与模型能力演化相互强化。SEIF 包含四个角色:Instructor 负责生成越来越具挑战性的指令,Filter 负责剔除冲突或无效的指令以确保数据质量,Follower 负责学习跟随演化后的指令,Judger 负责为强化学习提供奖励信号。在整个过程中,Instructor 与 Follower 交替训练并共同演化。跨多个模型规模和架构的实验表明,SEIF 能稳健提升指令跟随性能,显示出强大的普适性。进一步分析揭示了改进的来源,并识别出在开放性任务上进行自演化的有效训练策略:充分的早期训练以构建坚实基础,随后适度的后期训练以缓解过拟合并获得更佳的最终性能。代码与数据已公开于 https://github.com/Rainier-rq1/SEIF。
引用
@article{arxiv.2605.07465,
title = {SEIF: Self-Evolving Reinforcement Learning for Instruction Following},
author = {Qingyu Ren and Qianyu He and Jiajie Zhu and Xingzhou Chen and Jingwen Chang and Zeye Sun and Han Xia and Fei Yu and Jiaqing Liang and Yanghua Xiao},
journal= {arXiv preprint arXiv:2605.07465},
year = {2026}
}