自适应激活抵消:用于大语言模型中幻觉缓解的方法
计算与语言
2026-03-12 v1 人工智能
机器学习
摘要
大语言模型经常生成流畅但事实错误的文本。我们提出了自适应激活抵消(Adaptive Activation Cancellation, AAC),这是一种在推理阶段实时运行的框架,将幻觉相关的神经激活视为变换器残差流中的结构性干扰,借鉴了信号处理中经典的自适应噪声消除方法。该框架通过层级线性探测识别幻觉节点(Hallucination Nodes, H-Nodes),并在自回归生成期间使用置信度加权的前向钩子进行抑制——无需外部知识、无需微调、无需额外的推理步骤。在OPT-125M、Phi-3-mini和LLaMA 3-8B模型上评估,使用实时钩子是唯一在所有三个规模上持续提高下游准确率的干预。关键的是,该方法严格属于手术操作:WikiText-103困惑度和MMLU推理准确率在所有三个模型规模上均保持为0.0%的零损失,这一特性使AAC区别于那些以事实改善为代价牺牲流畅性或通用能力的干预。在LLaMA 3-8B规模上,钩子还产生了正面的生成层面收益(MC1 +0.04;MC2 +0.003;Token-F1 +0.003),同时实现了比ITI基线高5.94倍至3.5倍的探针空间选择性——表明针对性的神经元级抑制能够同时提升事实准确性并保持模型能力。
引用
@article{arxiv.2603.10195,
title = {Adaptive Activation Cancellation for Hallucination Mitigation in Large Language Models},
author = {Eric Yocam and Varghese Vaidyan and Gurcan Comert and Paris Kalathas and Yong Wang and Judith L. Mwakalonge},
journal= {arXiv preprint arXiv:2603.10195},
year = {2026}
}
备注
19 pages, 8 figures, 23 tables