中文

置信流形:语言模型中正确性表示的几何结构

机器学习 2026-02-10 v1 人工智能 计算与语言

摘要

当一个语言模型断言“澳大利亚的首都是悉尼”时,它是否知道这是错误的?我们刻画了来自5种架构家族的9个模型中正确性表示的几何结构。该结构很简单:判别信号占据3-8个维度,增加额外维度会降低性能,且没有非线性分类器能优于线性分离。低维子空间中的质心距离与训练好的探针性能(0.90 AUC)相匹配,从而实现了少样本检测:在GPT-2上,25个标注样本达到了全数据准确率的89%。我们通过激活引导进行了因果验证:学习到的方向在错误率上产生了10.9个百分点的变化,而随机方向则没有影响。内部探针达到了0.80-0.97 AUC;基于输出的方法(P(True)、语义熵)仅达到0.44-0.64 AUC。正确性信号存在于内部,但并未在输出中表达。质心距离与探针性能相匹配表明类别分离是一种均值偏移,使得检测是几何性的而非学习性的。

关键词

引用

@article{arxiv.2602.08159,
  title  = {The Confidence Manifold: Geometric Structure of Correctness Representations in Language Models},
  author = {Seonglae Cho and Zekun Wu and Kleyton Da Costa and Adriano Koshiyama},
  journal= {arXiv preprint arXiv:2602.08159},
  year   = {2026}
}