CEPA:用于后门不可知检测与反转的共识嵌入扰动
密码学与安全
2025-03-10 v3 机器学习
神经与进化计算
摘要
针对植入深度神经网络(DNN)分类器的木马(后门攻击),人们已经提出了多种防御方法。后门不可知方法旨在可靠地检测和/或缓解后门,而不论攻击者使用的植入机制如何;而反转方法则明确假设了某种机制。在本文中,我们描述了一种新的检测器:它依赖嵌入的特征表示来估计(反转)后门并识别其目标类别;可以在不访问训练数据集的情况下运行;并且对各种植入机制都非常有效(即后门不可知)。我们的检测方法在 CIFAR-10 和 CIFAR-100 图像分类领域内,针对多种不同攻击与一系列已发表的防御方法进行了评估,并表现出优越的性能。
引用
@article{arxiv.2402.02034,
title = {CEPA: Consensus Embedded Perturbation for Agnostic Detection and Inversion of Backdoors},
author = {Guangmingmei Yang and Xi Li and Hang Wang and David J. Miller and George Kesidis},
journal= {arXiv preprint arXiv:2402.02034},
year = {2025}
}