PRISM:无验证奖励的大语言模型后训练统一框架
计算与语言
2026-01-21 v2
摘要
当前用于大语言模型(LLM)后训练的技术,要么依赖于昂贵的人工监督,要么依赖于外部验证器来提升在数学推理和代码生成等任务上的性能。然而,随着 LLM 解决问题能力的提升,任何进一步的改进都可能需要人类无法提供的困难问题的高质量解答。因此,从无标签数据中学习在研究社区中变得越来越有吸引力。现有方法通过多数投票或将模型的内部置信度转化为奖励,从模型的一致性中提取学习信号。尽管诸如熵或自确定性等内部一致性指标不需要人工干预,但正如我们在本工作中所展示的,对于大规模和长期训练而言,它们是不可靠的信号。为了解决这种不可靠性,我们提出了 PRISM,这是一个在缺乏真值标签的情况下,使用过程奖励模型(PRM)结合模型内部置信度来指导学习的统一训练框架。我们表明,有效地将 PRM 与自确定性相结合,既能带来稳定的训练和更好的测试时性能,也能对模型的内部置信度进行约束。代码可在 https://github.com/ghimiremukesh/PRISM 获取。
引用
@article{arxiv.2601.04700,
title = {PRISM: A Unified Framework for Post-Training LLMs Without Verifiable Rewards},
author = {Mukesh Ghimire and Aosong Feng and Liwen You and Youzhi Luo and Fang Liu and Xuan Zhu},
journal= {arXiv preprint arXiv:2601.04700},
year = {2026}
}
备注
Added open-sourced github url