超越权衡:自监督强化学习用于推理模型指令跟随
人工智能
2025-08-05 v1
摘要
推理模型在复杂问题解决方面表现出色,但在推理能力与指令跟随能力之间存在令人担忧的权衡。现有方法依赖更强大的外部模型改进指令跟随,导致方法论瓶颈和实际限制,包括增加成本和可及性约束。我们提出一种自监督强化学习框架,利用推理模型自身的内部信号,在无外部监督的情况下提升指令跟随能力。广泛实验表明,我们框架显著提升指令跟随能力,同时保持推理性能,提供一种可扩展且高性价比的提升推理模型指令跟随方法。数据和代码已公开于https://github.com/Rainier-rq/verl-if。
引用
@article{arxiv.2508.02150,
title = {Beyond the Trade-off: Self-Supervised Reinforcement Learning for Reasoning Models' Instruction Following},
author = {Qingyu Ren and Qianyu He and Bowei Zhang and Jie Zeng and Jiaqing Liang and Yanghua Xiao and Weikang Zhou and Zeye Sun and Fei Yu},
journal= {arXiv preprint arXiv:2508.02150},
year = {2025}
}