用于大语言模型幻觉检测的预测编码与信息瓶颈
人工智能
2026-01-23 v1 密码学与安全
新兴技术
摘要
大语言模型 (LLMs) 中的幻觉——即看似合理但事实上不忠实的生成内容——仍然是高风险部署的关键障碍。当前的检测方法通常依赖于计算成本高昂的外部检索循环或需要 70B+ 参数的不透明黑盒 LLM 评判器。在这项工作中,我们引入了 [Model Name],一个结合了神经科学启发的信号设计与监督式机器学习的混合检测框架。我们提取了基于预测编码(量化相对于内部先验的意外程度)和信息瓶颈(测量扰动下的信号保留)的可解释信号。通过系统消融,我们展示了三项关键增强:实体聚焦吸收(集中于高价值词元)、上下文遵循(测量基础牢固度)和可证伪性得分(检测自信但矛盾的声明)。在 HaluBench(n=200,完全平衡)上进行评估,我们的理论引导基线达到了 0.8017 AUROC。BASE 监督模型达到 0.8274 AUROC,而 IMPROVED 特征将性能提升至 0.8669 AUROC(增益 4.95%),展示了跨架构的一致性改进。这一具有竞争力的性能是在使用比 Lynx 少 75 倍的训练数据(200 对 15,000 样本)、快 1000 倍的推理速度(5ms 对 5s)且保持完全可解释性的情况下实现的。至关重要的是,我们报告了一个负面结果:合理化信号未能区分幻觉,这表明 LLMs 会为错误前提生成连贯的推理(“谄媚”)。这项工作表明,编码在信号架构中的领域知识提供了优于扩展 LLM 评判器的数据效率,以轻量级(参数少于 1M)、可解释的模型实现了适合生产部署的强大性能。
引用
@article{arxiv.2601.15652,
title = {Predictive Coding and Information Bottleneck for Hallucination Detection in Large Language Models},
author = {Manish Bhatt},
journal= {arXiv preprint arXiv:2601.15652},
year = {2026}
}