情境如何塑造真理:大语言模型中语句级真理表征的几何变换
计算与语言
2026-01-13 v1 人工智能
摘要
大型语言模型(LLMs)常在其残差流激活中对语句的真假进行编码。这些向量也称为真理向量,已在 prior work 中受到研究,但关于它们在引入情境后如何变化的研究仍鲜见。我们通过测量(1)带情境与无情境真理向量之间的方向变化(),以及(2)在加入情境后真理向量的相对大小来研究此问题。在四个大语言模型和四个数据集上,我们发现(1)在早期层中,真理向量大致呈正交;在中层中趋于一致;在后期层中可能稳定或继续增加;(2)加入情境通常会增加真理向量的大小,即在激活空间中 true 与 false 表征之间的分离被放大;(3)大型模型主要通过方向变化()区分相关与不相关情境,而小型模型则通过大小差异表现出这一区别。我们还发现,与参数化知识相冲突的情境比参数化一致的情境产生更大的几何变化。据我们了解,这是首个对大语言模型激活空间中真理向量如何随情境变换进行几何特征化的工作。
引用
@article{arxiv.2601.06599,
title = {How Context Shapes Truth: Geometric Transformations of Statement-level Truth Representations in LLMs},
author = {Shivam Adarsh and Maria Maistro and Christina Lioma},
journal= {arXiv preprint arXiv:2601.06599},
year = {2026}
}