中文

测试 LLM 中真理方向的极限

计算与语言 2026-04-07 v1 人工智能

摘要

大型语言模型 (LLM) 已被证实在其激活空间中沿线性真理方向编码语句的真实性。之前的研究认为这些方向在某些方面具有普遍性,而更近期的工作则基于有限的实验设置质疑了这一结论。本文识别了若干尚未被理解的真理方向普遍性限制。首先,我们表明真理方向高度依赖于网络层级,需要在多个层面上进行探测才能充分理解其普遍性。其次,我们表明真理方向严重依赖于任务类型,事实类任务的真理方向在较早层中出现,而推理类任务则在较晚层中出现;它们在任务复杂度不同水平上的表现也各不相同。最后,我们表明模型指令对真理方向影响显著;简单的正确性评估指令显著影响真理探针的泛化能力。我们的发现表明,关于真理方向普遍性的论断比此前所知的更为有限,在 various model 层级、任务难度、任务类型以及提示模板方面都存在显著差异。

关键词

引用

@article{arxiv.2604.03754,
  title  = {Testing the Limits of Truth Directions in LLMs},
  author = {Angelos Poulis and Mark Crovella and Evimaria Terzi},
  journal= {arXiv preprint arXiv:2604.03754},
  year   = {2026}
}