中文

通过内部状态分析与聚类可视化与基准测试 LLM 事实幻觉倾向

计算与语言 2026-02-13 v1 人工智能

摘要

大型语言模型(LLM)常发生幻觉,生成荒谬或错误信息,这在医疗或法律等敏感领域尤为有害。为系统研究此现象,我们引入 FalseCite,一个精选数据集旨在捕获并基准测试因误导或虚构引用诱导的幻觉响应。我们将 GPT-4o-mini、Falcon-7B 和 Mistral 7-B 三个模型通过 FalseCite 测试,发现伪造声明伴随误导性引用时,幻觉活动显著增加,尤其在 GPT-4o-mini 中表现突出。利用 FalseCite 的响应数据,我们还能分析幻觉模型的内部状态,通过可视化和聚类隐藏状态向量。我们的分析发现,无论是否发生幻觉,隐藏状态向量都呈现出类似角形的特征。我们的工作凸显了 FalseCite 作为未来 LLM 研究中评估与缓解幻觉的基础潜力。

关键词

引用

@article{arxiv.2602.11167,
  title  = {Visualizing and Benchmarking LLM Factual Hallucination Tendencies via Internal State Analysis and Clustering},
  author = {Nathan Mao and Varun Kaushik and Shreya Shivkumar and Parham Sharafoleslami and Kevin Zhu and Sunishchal Dev},
  journal= {arXiv preprint arXiv:2602.11167},
  year   = {2026}
}