置信度并不等同于能力
计算与语言
2025-10-30 v1 人工智能
摘要
大型语言模型(LLMs)常常表现出一种令人困惑的信心与实际问题解决能力之间的脱节。我们通过分析两个阶段(预生成评估和解决方案执行)中内部状态的几何结构,提供了这种解耦的机制性解释。一种简单的线性探针可解码模型内部的“可解性信念”,揭示出一种在模型家族之间以及数学、代码、规划和逻辑任务中均可推广的有序信念轴。然而,几何结构却发生了分歧——尽管信念是可线性解码的,但评估流形的有效线性维数通过主成分进行测量时较高,而随后推理轨迹则在much lower维度的流形上演化。这种从思考到行动的几何复杂性的锐利降低,从机械上解释了信心-能力之间的差距。对表示量沿信念轴进行的因果干预未能改变最终解决方案,表明对复杂评估空间中的线性轻微推动并不控制执行的受限动力学。因此,我们发现了一种两种系统的架构——一个几何复杂的评估器 feeding 给几何简单的执行器。这一结果挑战了可解码信念是可操作杠杆的假设,反之主张要针对执行的程序动力学而非评估的高层几何结构进行干预。
引用
@article{arxiv.2510.24772,
title = {Confidence is Not Competence},
author = {Debdeep Sanyal and Manya Pandey and Dhruv Kumar and Saurabh Deshpande and Murari Mandal},
journal= {arXiv preprint arXiv:2510.24772},
year = {2025}
}
备注
20 Pages, 6 Figures, 8 Tables