中文

解构 LLM 中的欺骗与幻觉失效

人工智能 2026-02-17 v1

摘要

大型语言模型 (LLM) 的失效常从行为角度进行分析,在事实性问答中,错误输出常被关联到知识缺失。本文聚焦实体类事实性查询,提出可能混合不同失效机制的观点,并提出一种内部、机制导向的视角,将知识存在性与行为表达分离。 在此框架下,幻觉与欺骗对应两种在输出层看似相似却在底层机制上存在差异的失效模式。为研究这一区别,我们构建了一个在实体导向事实问题环境中,知识得以保留而行为表达可被选择性改变的控制环境,使能够系统性地分析四种行为情况。我们通过表示可分性、稀疏可解释性和推理时激活操控来分析这些失效模式。

关键词

引用

@article{arxiv.2602.14529,
  title  = {Disentangling Deception and Hallucination Failures in LLMs},
  author = {Haolang Lu and Hongrui Peng and WeiYe Fu and Guoshun Nan and Xinye Cao and Xingrui Li and Hongcan Guo and Kun Wang},
  journal= {arXiv preprint arXiv:2602.14529},
  year   = {2026}
}