中文

指令即所需:基于自监督强化学习的指令跟随

计算与语言 2026-04-15 v4 人工智能

摘要

语言模型常常难以遵循对现实应用至关重要的多约束指令。现有强化学习(RL)方法受限于外部监督和多约束任务中稀疏的奖励信号。我们提出一种无标签自监督RL框架,通过从指令中直接派生奖励信号并生成奖励模型训练的伪标签来消除对外部监督的依赖。我们的 метод引入了约束分解策略和高效约束级二元分类,以解决稀疏奖励问题同时保持计算效率。实验表明,我们的方法在3个领域内和5个领域外的数据集上都能很好地泛化,实现了显著的改进,包括具有挑战性的代理式和多轮指令跟随。该数据和代码已公开于https://github.com/Rainier-rq/verl-if。

关键词

引用

@article{arxiv.2510.14420,
  title  = {Instructions are all you need: Self-supervised Reinforcement Learning for Instruction Following},
  author = {Qingyu Ren and Qianyu He and Powei Chang and Jie Zeng and Zeye Sun and Fei Yu and Jiaqing Liang and Yanghua Xiao},
  journal= {arXiv preprint arXiv:2510.14420},
  year   = {2026}
}