PiCSAR:基于概率置信度的推理链选择与排序
计算与语言
2026-05-01 v2 人工智能
摘要
最佳 n 次抽样通过生成多个候选解决方案并选择获得最高奖励的那个来提高大型语言模型 (LLM) 和大型推理模型 (LRM) 的准确率。推理任务的关键挑战在于设计一种无需访问真实答案即可识别正确推理链的评分函数。我们提出了概率置信度选择与排序 (PiCSAR):一种简单且无需训练的方法,通过推理与最终答案的联合对数似然为每个候选生成评分。推理与最终答案的联合对数似然自然分解为推理置信度和答案置信度。PiCSAR 在 diverse benchmarks 上实现了显著的提升 (+10.18 的 MATH500, +9.81 的 AIME2025),在 16 个 20 个比较中以至少 2 倍的样本数超过基线。我们的分析揭示,正确的推理链在推理置信度和答案置信度方面显著高于其他情况,合理解释了 PiCSAR 的有效性。
引用
@article{arxiv.2508.21787,
title = {PiCSAR: Probabilistic Confidence Selection And Ranking for Reasoning Chains},
author = {Joshua Ong Jun Leang and Zheng Zhao and Aryo Pradipta Gema and Sohee Yang and Wai-Chung Kwan and Xuanli He and Wenda Li and Pasquale Minervini and Eleonora Giunchiglia and Shay B. Cohen},
journal= {arXiv preprint arXiv:2508.21787},
year = {2026}
}