一箭双雕!基于轨迹的统一在线检测对抗样本与后门攻击
密码学与安全
2025-07-01 v1 人工智能
摘要
本文提出的 UniGuard 是首个能够同时应对对抗样本和后门攻击的统一在线检测框架。UniGuard 基于两个关键洞察:首先,AE 和后门攻击都必须破坏推理阶段,通过在运行时进行在线检测有望同时处理两者;其次,无论是 AE 攻击中的扰动样本,还是后门攻击中的触发器携带样本,其在深度学习模型前向推理过程中都呈现出与良性样本不同的轨迹特征。若 Adversarial 样本的传播轨迹与其良性对应物相同,则无法实现其对抗目标。由于这些轨迹特征极其微妙,检测它们具有内在挑战性;UniGuard 通过将传播轨迹视为时序信号,运用 LSTM 和频谱转换技术,以放大时域下对抗性和良性轨迹之间的细微差异。UniGuard 在各种模态(图像、文本、音频)和任务(分类、回归)上的卓越效率与效果得到充分验证,涵盖多样模型架构,针对广泛的 AE 攻击和后门攻击,包括艰巨的部分后门和动态触发器。与 SOTA 方法(包括专用于 AE 检测的 ContraNet 和专用于后门检测的 TED)相比,UniGuard 在每个方法各自优势所在的攻击策略上均表现出色——每个 SOTA 方法在各自针对的威胁上都有盲点,而 UniGuard 能覆盖所有攻击策略。
引用
@article{arxiv.2506.22722,
title = {Kill Two Birds with One Stone! Trajectory enabled Unified Online Detection of Adversarial Examples and Backdoor Attacks},
author = {Anmin Fu and Fanyu Meng and Huaibing Peng and Hua Ma and Zhi Zhang and Yifeng Zheng and Willy Susilo and Yansong Gao},
journal= {arXiv preprint arXiv:2506.22722},
year = {2025}
}