中文

偏见假扮真理:虚假关联如何削弱 LLM 中的幻觉检测

计算与语言 2025-11-24 v2 人工智能 机器学习

摘要

尽管取得了显著进展,大型语言模型(LLM)仍会出现幻觉现象,生成看似合理却不正确的响应。本文突出了一个尚未充分探讨的幻觉类别,这类幻觉由虚假关联引发——训练数据中存在的浅层但统计上显著的特征(如姓氏)与属性(如国籍)之间的关联。我们展示,这些虚假关联诱导的幻觉具有自信水平、免疫模型规模、规避当前检测方法,以及在拒绝微调后仍然持久。通过系统控制的合成实验和对最新开源及商业 LLM(包括 GPT-5)的实证评估,我们表明现有幻觉检测方法(如基于置信度的过滤和内部状态探针)在虚假关联存在时根本性失败。我们的理论分析进一步阐明了这些统计偏见为何本质上削弱基于置信度的检测技术。因此,我们的发现强调了迫切需要新的方法以专门应对由虚假关联引发的幻觉的紧迫性。

关键词

引用

@article{arxiv.2511.07318,
  title  = {When Bias Pretends to Be Truth: How Spurious Correlations Undermine Hallucination Detection in LLMs},
  author = {Shaowen Wang and Yiqi Dong and Ruinian Chang and Tansheng Zhu and Yuebo Sun and Kaifeng Lyu and Jian Li},
  journal= {arXiv preprint arXiv:2511.07318},
  year   = {2025}
}