中文

幻觉神经元具有泛化能力吗?来自 LLM 跨领域迁移的证据

计算与语言 2026-04-23 v1 人工智能

摘要

近期工作识别出一组稀疏的“幻觉神经元”(H-neurons),其数量不到前馈网络神经元的 0.1%,能够可靠预测大型语言模型何时产生幻觉。这些神经元是在常识问答任务上识别出来的,并已被证明可以泛化到新的评估实例。我们提出一个自然的后续问题:H-neurons 能否跨知识领域泛化?通过在 6 个领域(常识问答、法律、金融、科学、道德推理和代码漏洞)和 5 个开放权重模型(3B 至 8B 参数)上使用系统的跨领域迁移协议,我们发现它们并不能泛化。在一个领域的 H-neurons 上训练的分类器在同领域内取得了 0.783 的 AUROC,但迁移到不同领域时仅为 0.563(delta = 0.220,p < 0.001),这种性能下降在所有测试模型中均一致存在。我们的结果表明,幻觉并不是一种具有通用神经表征的单一机制,而是涉及特定领域的神经元群体,这些群体因所查询的知识类型而异。这一发现对神经元级别的幻觉检测器的部署具有直接启示:检测器必须按领域进行校准,而不能训练一次便普遍适用。

关键词

引用

@article{arxiv.2604.19765,
  title  = {Do Hallucination Neurons Generalize? Evidence from Cross-Domain Transfer in LLMs},
  author = {Snehit Vaddi and Pujith Vaddi},
  journal= {arXiv preprint arXiv:2604.19765},
  year   = {2026}
}

备注

18 pages, 5 models, 6 domains, ACL format. Includes causal intervention analysis