中文

语言模型中的真值判断: 'truth directions' 是上下文敏感的

计算与语言 2025-07-14 v3

摘要

最近的工作表明,大语言模型(LLM)的潜在空间包含可预测句子真值的方向. 多个方法恢复此类方向并构建描述为揭示模型"知识"或"信念"的探针. 我们调查此现象,深入关注上下文对探针的影响. 我们的实验确立了LLM中探针预测(最)敏感的位置,以及如何最佳描述此类灵敏度. 我们通过测量不同类型的一致性错误来实现这一点,这些错误发生在对其输入由假设后接(否定)支持句和矛盾句的LLM进行探针. 我们还进行了因果干预实验,探讨沿着这些真值方向移动前提表示是否影响被包含或矛盾句子在该同一方向上的位置. 我们发现我们测试的探针通常是上下文敏感的,但应不影响真值的上下文仍会影响探针输出. 我们的实验表明,错误类型取决于层、模型和数据类型. 最终,我们的结果表明,真值方向是推理过程中的因果中介者,吸收了包含的上下文信息.

关键词

引用

@article{arxiv.2404.18865,
  title  = {Truth-value judgment in language models: 'truth directions' are context sensitive},
  author = {Stefan F. Schouten and Peter Bloem and Ilia Markov and Piek Vossen},
  journal= {arXiv preprint arXiv:2404.18865},
  year   = {2025}
}

备注

COLM 2025