中文

弱监督下大语言模型何时能够学习推理?

机器学习 2026-04-21 v1 人工智能

摘要

大语言模型通过使用可验证奖励的强化学习(RLVR)取得了显著的推理改进。然而随着模型能力的提升,构建高质量奖励信号变得日益困难,这使得理解在较弱形式的监督下 RLVR 何时能够成功变得至关重要。我们在多样化的模型家族和推理领域下,围绕三种弱监督设置(稀缺数据、噪声奖励和自监督代理奖励)进行系统实证研究。我们发现,泛化性由训练奖励饱和动力学决定:能够实现泛化的模型在训练奖励和下游性能同步上升的长期未饱和阶段中表现良好,而那些迅速饱和的模型则会记忆而非学习。我们确定推理忠诚度——即中间步骤在逻辑上如何支持最终答案的程度——是预测模型所处于哪个 regime 的 RL 前属性,而输出多样性单独无法提供信息。鼓励这些发现,我们 disentangle 了持续预训练和监督微调的贡献,发现针对显式推理痕迹的 SFT 是弱监督下实现泛化的必要条件,而领域数据上的持续预训练可放大这种效果。应用于 Llama3.2-3B-Base,这些干预措施使其在三个设置中实现泛化,而该基础模型之前未能实现。

关键词

引用

@article{arxiv.2604.18574,
  title  = {When Can LLMs Learn to Reason with Weak Supervision?},
  author = {Salman Rahman and Jingyan Shen and Anna Mordvina and Hamid Palangi and Saadia Gabriel and Pavel Izmailov},
  journal= {arXiv preprint arXiv:2604.18574},
  year   = {2026}
}