大语言模型中真理的表征与行为稳定性
计算与语言
2026-01-21 v3
摘要
大语言模型(LLMs)日益被用作信息来源,但即使在语义表述上细微的变化也可能导致它们的真理判断不稳定。我们提出P-StaT(Perturbation Stability of Truth),一个用于测试信念在受控语义扰动下的表征与行为稳定性的评估框架,通过探测和零样本提示实现。我们在十六个开源LLM和三个领域上进行测试,比较涉及来自众所周知虚构情境中既熟悉又不熟悉的Neither表述(Fictional)与那些不在训练数据中出现的Neither表述(Synthetic)之间的扰动。我们发现稳定性呈现一致的层次结构:Synthetic内容与事实表征高度吻合,导致对先前持有信念的最大收回,分别在表征评估中达到最高32.7%,在行为评估中达到最高36.3%。相比之下,Fictional内容在表征上更为独特且相对稳定。总体而言,这些结果表明,认识熟悉度是信念稳定性在语义重构情境下稳健的信号,这补充了以准确性为导向的事实性评估,引入了一种认识稳健性的概念。
引用
@article{arxiv.2511.19166,
title = {Representational and Behavioral Stability of Truth in Large Language Models},
author = {Samantha Dies and Courtney Maynard and Germans Savcisens and Tina Eliassi-Rad},
journal= {arXiv preprint arXiv:2511.19166},
year = {2026}
}
备注
25 pages, 26 figures