生成前捕获污染:基于谱特征的代理杀手开关
机器学习
2025-11-11 v1 系统与控制
信号处理
系统与控制
机器学习
摘要
代理式语言模型构建多步推理链,但中间步骤可能因不一致的上下文、检索错误或对抗性输入而被污染,这使得事后评估已晚,因为错误会在检测之前传播。我们引入一种无需额外训练、仅依赖前向传播即可在代理执行期间发出二元接受或拒绝信号的诊断工具。该方法分析由注意力机制诱导的 token 图,并计算前层的两种谱统计量,即高频能量比和谱熵。我们形式化了这些信号,建立了不变性,并提供了具有不确定性量化的有限样本估计器。在两种 regime 混合假设并具单调似然比属性的条件下,我们证明高频能量比的单个阈值在贝叶斯意义上对检测上下文不一致是最优的。实验上,高频能量比在多个模型家族中展现出鲁妙的双模分布,这使得在我们的硬件和配置下以低于 1 毫秒的开销进行门控决策成为可能。我们演示了将其集成到检索增强代理管道中,并讨论了作为内联安全监视器的部署。该方法在模型仍在处理文本时检测污染, 在错误提交到推理链之前。
引用
@article{arxiv.2511.05804,
title = {Catching Contamination Before Generation: Spectral Kill Switches for Agents},
author = {Valentin Noël},
journal= {arXiv preprint arXiv:2511.05804},
year = {2025}
}
备注
Preprint under review (2025). 9 pages, 2 figures. Code and scripts: to be released