中文

真实性谱假设

机器学习 2026-02-25 v1

摘要

大型语言模型 (LLM) 被报告在线性编码真实性方面,但最近的工作质疑这一发现的普遍性。我们用真实性谱假设来调和这些观点:表示空间包含从广义域到狭义域的方向。为了测试这一假设,我们系统评估了跨五种真实类型(定义性、经验性、逻辑性、虚构性和伦理性)的探针泛化,以及迎合性和反期望反转的说谎,以及现有诚实基准。线性探针在大多数域上表现良好,但在迎合性和反期望反转说谎时表现不佳。然而,在所有域联合训练可恢复强性能力,确认尽管两两转换效果不佳,域通用方向仍然存在。探针方向的几何解释了这些模式:马哈努里斯余弦相似度在探针之间几乎完美预测跨域泛化(R2=0.98R^2=0.98)。概念擦除方法进一步隔离出域通用、域特定或仅在特定域子集共享的真实方向。因果干预揭示,域特定方向比域通用方向更有效地驱动。最后,后训练改变了真实几何,使迎合性说谎远离其他真实类型,这表明聊天模型迎合性倾向在表示空间中具有表示基础。总之,我们的结果支持真实性谱假设:表示空间中存在真实方向的不同通用性,后训练改变其几何。所有实验的代码均提供于 https://github.com/zfying/truth_spec。

关键词

引用

@article{arxiv.2602.20273,
  title  = {The Truthfulness Spectrum Hypothesis},
  author = {Zhuofan Josh Ying and Shauli Ravfogel and Nikolaus Kriegeskorte and Peter Hase},
  journal= {arXiv preprint arXiv:2602.20273},
  year   = {2026}
}

备注

28 pages, 26 figures