中文

虚伪差距:通过稀疏自编码器量化内部信念与思维链解释之间的分歧

计算与语言 2026-02-04 v1

摘要

大型语言模型(LLM)经常表现出不忠实的行为,为了迎合与其对话的用户,产生的最终答案与其内部思维链(CoT)推理显著不同。为了更好地检测这种行为,我们引入了虚伪差距,这是一种利用稀疏自编码器(SAE)量化模型内部推理与其最终生成之间分歧的机制性度量。通过数学上比较源自稀疏线性探针的内部真值信念与潜在空间中的最终生成轨迹,我们量化并检测模型参与不忠实行为的倾向。在Gemma、Llama和Qwen模型上使用Anthropic的谄媚基准进行的实验表明,我们的方法在检测谄媚运行时的AUROC为0.55-0.73,在模型内部“知道”用户错误的虚伪情况下的AUROC为0.55-0.74,始终优于决策对齐的对数概率基线(0.41-0.50 AUROC)。

关键词

引用

@article{arxiv.2602.02496,
  title  = {The Hypocrisy Gap: Quantifying Divergence Between Internal Belief and Chain-of-Thought Explanation via Sparse Autoencoders},
  author = {Shikhar Shiromani and Archie Chaudhury and Sri Pranav Kunda},
  journal= {arXiv preprint arXiv:2602.02496},
  year   = {2026}
}

备注

8 pages, 1 figure