中文

基于LLM中价值向量的无训练真实性检测

计算与语言 2025-09-23 v1

摘要

大型语言模型常生成事实错误的输出,动员了检测其内容真实性的努力。大多数现有方法依赖在内部激活上训练探针,但这些方法存在可扩展性和泛化问题。最近一种无训练方法NoVo通过利用模型自身的统计模式来解决此挑战。然而,它仅关注注意力机制,可能忽略了被动力学模块——这是一种被先前无训练努力所忽略的Transformer模型的核心组件,已知支持事实记忆。在本文中,我们发现某些价值向量在MLP模块中表现出与真实性相关的统计模式。基于此洞察,我们提出TruthV,一种简单且可解释的无训练方法,通过利用这些价值向量来检测内容的真实性。在NoVo基准测试中,TruthV显著优于NoVo和对数似然基线,表明尽管先前无训练努力忽略了MLP模块,后者仍编码了丰富且有用的信号用于真实性检测。这些发现为如何在LLM中内部表示真实性提供了新见解,并激励进一步研究可扩展且可解释的真实性检测。

关键词

引用

@article{arxiv.2509.17932,
  title  = {Training-free Truthfulness Detection via Value Vectors in LLMs},
  author = {Runheng Liu and Heyan Huang and Xingchen Xiao and Zhijing Wu},
  journal= {arXiv preprint arXiv:2509.17932},
  year   = {2025}
}