中文

大语言模型中的H-Node攻击与防御

机器学习 2026-03-30 v1 人工智能 计算与语言 神经与进化计算

摘要

我们提出了H-Node对抗噪声消除(H-Node ANC),一种机制框架,用于在基于Transformer的大语言模型(LLMs)的单个隐藏状态维度层面识别、利用和防御幻觉表示。通过在末标记隐藏状态上训练的逻辑回归探针,幻觉信号被定位到一组高方差维度——称为幻觉节点(H-Nodes)——在四个架构上探针AUC达到0.90。白盒对抗攻击通过实时前向钩子在推理时放大这些维度,在对防御者可见度低于10%的情况下实现3.02倍的选择性。自适应ANC防御通过置信度加权消除来抑制H-Node的过度激活,将基线激活漂移减少33-42%。一种动态迭代扩展在连续多次传递中重新排序消除目标,从单次传递基线8%恢复高达0.69的鲁棒性。所有贡献均在OPT-125M、Phi-3-mini-4k-instruct、LLaMA-3-8B-Instruct和Mistral-7B-Instruct-v0.3(125M-8B参数)上得到验证。困惑度影响是精确的(<5%),MMLU退化最多为3%,确认该防御不会损害通用推理能力。

关键词

引用

@article{arxiv.2603.26045,
  title  = {H-Node Attack and Defense in Large Language Models},
  author = {Eric Yocam and Varghese Vaidyan and Yong Wang},
  journal= {arXiv preprint arXiv:2603.26045},
  year   = {2026}
}

备注

17 pages, 7 figures, 6 tables