KoALA:基于标签一致性的 KL-L0 对抗检测器
机器学习
2026-03-23 v2
摘要
深度神经网络对对抗攻击极其敏感,这对安全和安全关键应用构成重大风险。我们提出 KoALA(KL-L0 Adversarial detection via Label Agreement),一种新型无语义的对抗检测器,无需架构修改或对抗再训练。KoALA 基于简单原则运作:当两种互补相似度度量标准得到的类别预测不一致时,即检测到对抗攻击。这两种度量标准——KL 发散和 L0 基于相似度——分别针对不同类型的扰动进行设计。KL 发散度量对密集、低幅度偏移敏感,而 L0 基于相似度针对稀疏、高影响变化而设计。我们为该方法提供形式正确性证明。唯一需要的训练是使用干净图像对预训练图像编码器进行简单的微调,以确保嵌入与两种度量标准良好对齐。这使得 KoALA 成为一种轻量级、即插即用的数据模态解决方案。我们在 ResNet/CIFAR-10 和 CLIP/Tiny-ImageNet 上进行大规模实验,确认了理论主张。当定理条件满足时,KoALA 在测试集上实现了 0.96 的精确率和 0.97 的召回率(ResNet/CIFAR-10),以及 0.71 的精确率和 0.94 的召回率(CLIP/Tiny-ImageNet)。
引用
@article{arxiv.2510.12752,
title = {KoALA: KL-L0 Adversarial Detector via Label Agreement},
author = {Siqi Li and Yasser Shoukry},
journal= {arXiv preprint arXiv:2510.12752},
year = {2026}
}