置信水平感知的对齐提升大模型推理可靠性
人工智能
2026-05-11 v1
摘要
大型推理模型常通过不完美的中间步骤达到正确答案,在最终准确率与推理可靠性之间产生差距。现有对齐策略通过外部验证器或大量抽样来解决此问题,但限制了可扩展性。本文引入 CASPO (Confidence-Aware Step-wise Preference Optimization),一种通过迭代直接偏好优化实现 token 级别置信度与步骤逻辑正确性对齐的框架,无需训练独立的奖励模型。在推理期间,我们提出的置信感知思考 (Confidence-aware Thought, CaT) 利用此校准置信度,动态修剪不确定的推理分支,延迟仅为 O(V)。在十个基准测试和多个模型家族上的实验表明,CASPO 持续提高推理可靠性和推理效率。CASPO 可扩展至 Qwen3-8B-Base,并在 AIME'24 和 AIME'25 上超越基于树搜索的基线,无需使用奖励模型数据。我们还发布了一个带置信度注释的步骤级数据集,以支持推理可靠性的细粒度分析。代码已公开 https://github.com/Thecommonirin/CASPO
引用
@article{arxiv.2605.07353,
title = {Confidence-Aware Alignment Makes Reasoning LLMs More Reliable},
author = {Kejia Chen and Jiawen Zhang and Yihong Wu and Kewei Gao and Jian Lou and Zunlei Feng and Mingli Song and Ruoxi Jia},
journal= {arXiv preprint arXiv:2605.07353},
year = {2026}
}
备注
9 pages