中文

精度优于多样性:高精度奖励泛化至鲁棒的指令遵循

机器学习 2026-01-14 v2 人工智能

摘要

在指令遵循(IF)任务中,利用可验证奖励进行强化学习扩展的一个核心信念是,多样化的可验证硬约束和不可验证软约束混合对于泛化到未见指令至关重要。在这项工作中,我们通过系统的实证研究挑战了这一普遍共识。反直觉的是,我们发现仅在硬约束上训练的模型始终优于在混合数据集上训练的模型。大量实验表明,奖励精度而非约束多样性是有效对齐的主要驱动力。LLM评判器在检测错误响应方面召回率低,导致严重的奖励黑客行为,从而削弱了多样性的益处。此外,注意力机制的分析表明,高精度奖励发展出一种可迁移的IF元技能。受这些见解启发,我们提出了一种简单而有效的数据中心优化策略,优先考虑奖励精度。在五个基准测试上的评估表明,我们的方法在性能上优于竞争基线13.4%,同时训练时间减少了58%,并在指令遵循之外保持了强大的泛化能力。我们的发现倡导一种范式转变:从盲目追求数据多样性转向高精度奖励。

关键词

引用

@article{arxiv.2601.04954,
  title  = {Precision over Diversity: High-Precision Reward Generalizes to Robust Instruction Following},
  author = {Yirong Zeng and Yufei Liu and Xiao Ding and Yutai Hou and Yuxian Wang and Haonan Song and Wu Ning and Dandan Tu and Qixun Zhang and Bibo Cai and Yuxiang He and Ting Liu},
  journal= {arXiv preprint arXiv:2601.04954},
  year   = {2026}
}

备注

Under review, 13 pages, 8 figures