中文

IFDecorator:包装可验证奖励的指令跟随强化学习

计算与语言 2025-08-08 v2

摘要

基于可验证奖励的强化学习(RLVR)提高了大型语言模型(LLM)的指令跟随能力,但因难度评估不足导致训练效率低下。此外,RLVR 容易过度优化,LLM 会利用验证捷径而不符合用户指令的实际意图。在本文中,我们引入指令跟随装饰器(IFDecorator),一个将 RLVR 训练包装成稳健且样本高效管道的框架。它包含三个组件:(1)一个合作-对抗式数据飞轮, co-evolve 指令和混合验证,生成逐渐更具挑战性的指令-验证对;(2)IntentCheck,一个强制执行意图对齐的 bypass 模块;(3)trip wires,一种检测奖励作弊的诊断机制,通过陷阱指令触发并捕获捷径利用行为。我们的 Qwen2.5-32B-Instruct-IFDecorator 在 IFEval 上取得 87.43% 的准确率,超越了如 GPT-4o 等更大的专有模型。此外,我们在 FollowBench 上实现了显著提升,同时保持了通用能力。我们的 trip wires 在奖励作弊率方面显示出显著的降低。我们将发布模型、代码和数据供未来研究使用。

关键词

引用

@article{arxiv.2508.04632,
  title  = {IFDECORATOR: Wrapping Instruction Following Reinforcement Learning with Verifiable Rewards},
  author = {Xu Guo and Tianyi Liang and Tong Jian and Xiaogui Yang and Ling-I Wu and Chenhui Li and Zhihui Lu and Qipeng Guo and Kai Chen},
  journal= {arXiv preprint arXiv:2508.04632},
  year   = {2025}
}

备注

7 pages, 4 figures