基于功能归因的机械异常检测
机器学习
2026-05-26 v2 密码学与安全
摘要
我们通常可通过 ground truth 标签验证神经网络输出的正确性,但无法可靠地判断其输出是否由正常或异常的内部机制产生。机械异常检测 (MAD) 旨在标记此类情况,但现有方法要么依赖潜在空间分析,该方法易受隐蔽攻击,要么仅针对特定架构和模态。我们将 MAD 重新框定为函数归因问题:询问可信集合的样本在多大程度上能解释模型的输出,其中归因失败信号异常行为。我们通过 influence functions 实现该方法,通过参数空间抽样测量测试样本与小型参考集之间的函数耦合程度。我们在多种异常类型和模态上进行评估。对于视觉模型中的后门攻击,本方法在 BackdoorBench 上实现了该领域的 state-of-the-art 检测,平均 Defense Effectiveness Rating (DER) 为 0.93(所谓最佳者为 0.83),覆盖七种攻击和四个数据集。对于 LLM,本方法同样在几类后门类型上显著优于基准,包括针对显式隐蔽模型。除后门外,本方法还能检测对抗样本和 out-of-distribution 样本,并能在单个模型中区分多个异常机制。我们的结果确立了函数归因作为一种有效、模态无关的工具,用于检测已部署模型中的异常行为。
引用
@article{arxiv.2604.18970,
title = {Mechanistic Anomaly Detection via Functional Attribution},
author = {Hugo Lyons Keenan and Christopher Leckie and Sarah Erfani},
journal= {arXiv preprint arXiv:2604.18970},
year = {2026}
}
备注
ICML '26 Camera Ready