超越分布锐化:任务奖励的重要性
机器学习
2026-04-20 v1 人工智能
摘要
前沿模型通过将基于任务奖励的强化学习(RL)集成到训练管道中,展现出卓越能力,使其从纯粹的推理模型演化为复杂的智能体。然而,关于 RL 是否真正内化新技能,抑或仅通过锐化基础模型的分布来激发其潜在能力,仍存在争议。为解决此二元论问题,我们呈现了分布锐化与基于任务奖励的学习之间的显式比较,将 RL 作为实现两者范式的工具。我们的分析揭示了分布锐化的内在局限性,阐明了最优解为何不利以及该方法本质上不稳定的原因。此外,我们使用 Llama-3.2-3B-Instruct、Qwen2.5-3B-Instruct 和 Qwen3-4B-Instruct-2507 在数学数据集上进行实验,证实锐化仅带来有限提升,而纳入任务奖励信号可显著实现稳健的性能提升和稳定的学习。
引用
@article{arxiv.2604.16259,
title = {Beyond Distribution Sharpening: The Importance of Task Rewards},
author = {Sarthak Mittal and Leo Gagnon and Guillaume Lajoie},
journal= {arXiv preprint arXiv:2604.16259},
year = {2026}
}