通过逐步置信度归因诊断黑箱LLM的多步推理失败
计算与语言
2026-05-20 v1 人工智能
信息论
机器学习
math.IT
摘要
大型语言模型通过生成逐步解决方案在解答具有客观答案的推理任务方面取得了优异性能,但诊断多步推理轨迹可能出错的地方仍然困难。置信度估计提供了诊断信号,但现有方法局限于最终答案或需要内部模型访问。本文引入逐步置信度归因(SCA)框架,用于闭源LLM,仅基于生成的推理轨迹分配步骤级别置信度。SCA应用信息瓶颈原理:与正确解决方案中一致结构的步骤获得高置信度,而偏差被标记为可能出错的地方。我们提出两种互补方法:(1) NIBS,一种无参数IB方法用于无图结构的一致性度量,和(2) GIBS,一种基于图的IB模型通过可微掩码学习子图以捕获逻辑变异性。针对数学推理和多跳问答进行大规模实验表明,SCA可可靠地识别低置信度步骤,这些步骤与推理错误高度相关。此外,使用步骤级别置信度指导自我纠正,可使纠正成功率相对于答案级别反馈提高最高可达13.5%。
引用
@article{arxiv.2605.19228,
title = {Diagnosing Multi-step Reasoning Failures in Black-box LLMs via Stepwise Confidence Attribution},
author = {Xiaoou Liu and Tiejin Chen and Dengjia Zhang and Yaqing Wang and Lu Cheng and Hua Wei},
journal= {arXiv preprint arXiv:2605.19228},
year = {2026}
}
备注
Accepted by ICML 2026