基于注意力拓扑的野外智能体工具使用幻觉检测:光谱约束
机器学习
2026-02-10 v1 人工智能
信号处理
摘要
在野外部署自主智能体需要可靠的工具使用故障防护措施。我们提出一种基于注意力拓扑光谱分析的训练无关防护措施,作为补充监督方法。在 Llama 3.1 8B 上,我们的方法在多特征检测下实现 97.7% 的召回率,单一特征检测下实现 86.1% 的召回率和 81.0% 的精确率,无需任何标记训练数据。最令人惊讶的是,我们发现单层光谱特征几乎可以作为完美的幻觉检测器:Llama L26 Smoothness 实现 98.2% 的召回率(213/217 幻觉被捕获),Mistral L3 Entropy 实现 94.7% 的召回率。这表明幻觉不仅仅是错误的标记,而是一种热力学状态变化:模型的注意力在出错时会变得噪声化。通过在匹配领域进行受控跨模型评估(,,相同通用领域,幻觉率 20--22%),我们揭示了“吵闹的说谎者”现象:Llama 3.1 8B 的失败在光谱上是灾难性的且检测难度极大,而 Mistral 7B 实现了最佳鉴别(AUC 0.900)。这些发现确立了光谱分析作为智能体安全的原则方法。
引用
@article{arxiv.2602.08082,
title = {Spectral Guardrails for Agents in the Wild: Detecting Tool Use Hallucinations via Attention Topology},
author = {Valentin Noël},
journal= {arXiv preprint arXiv:2602.08082},
year = {2026}
}
备注
32 pages, 2 fgures, 18 tables