为过度自信而设计:LLM 中膨胀的口头化置信度的机制视角
计算与语言
2026-04-03 v1
摘要
大语言模型往往不仅错误,而且过度自信:当它们产生事实性错误的答案时,倾向于口头化过高的置信度而非表达不确定性。这种口头化过度自信可能误导用户并削弱置信度分数作为可靠不确定性信号的作用,但其内部机制仍了解甚少。我们对这种 LLM 中膨胀的口头化置信度进行了电路层面的机制分析,围绕三个轴线组织:将口头化置信度捕获为可微分的内部信号、识别因果膨胀该置信度的电路,以及利用这些洞察进行针对性的推理时校准。在两个指令微调 LLM 和三个数据集上,我们发现一组紧凑的多层感知机(MLP)块和注意力头集中在中后期层,持续在最终标记位置写入置信度膨胀信号。我们进一步表明,针对这些电路的推理时干预显著改善了校准度。综合来看,我们的结果表明 LLM 中的口头化过度自信由可识别的内部电路驱动,并可通过针对性干预加以缓解。
引用
@article{arxiv.2604.01457,
title = {Wired for Overconfidence: A Mechanistic Perspective on Inflated Verbalized Confidence in LLMs},
author = {Tianyi Zhao and Yinhan He and Wendy Zheng and Yujie Zhang and Chen Chen},
journal= {arXiv preprint arXiv:2604.01457},
year = {2026}
}