从像素到轨迹:通过时间印记的通用对抗样本检测
密码学与安全
2025-03-10 v1 人工智能
摘要
我们首次揭示了对抗样本(AE)攻击产生的可辨识的时间(或历史)轨迹印记。与现有研究全部聚焦于目标底层模型内部的空间(或静态)印记不同,我们提出了一种理解这些攻击的新鲜时间范式。最重要的发现是,这些印记被封装在单一的损失度量中,普遍跨越分类和回归等不同任务以及图像、文本和音频等不同模态。认识到对抗样本与干净样本之间损失的差异,我们利用这种时间印记进行 AE 检测,提出了 TRAIT(可追踪对抗性时间轨迹印记,TRaceable Adversarial temporal trajectory ImprinTs)。TRAIT 在最少的假设下运行,无需先验攻击知识,从而将检测挑战框定为单类分类问题。然而,由于缺乏传入输入的真实标签,对抗样本与干净样本之间构建的合成损失存在显著重叠,使得 AE 检测仍面临挑战。TRAIT 通过将合成损失转换为频谱特征来解决这一挑战,利用快速傅里叶变换技术来突出差异,借鉴了印记的时间特性,类似于时间序列信号。在包括 SMACK(USENIX Sec'2023)在内的 12 种 AE 攻击中,TRAIT 在全面评估的模态、任务、数据集和模型架构中展现出持续出色的性能。在所有场景中,TRAIT 实现了超过 97%(通常约 99%)的 AE 检测准确率,同时保持 1% 的错误拒绝率。TRAIT 在所制定的强自适应攻击下仍然有效。
引用
@article{arxiv.2503.04853,
title = {From Pixels to Trajectory: Universal Adversarial Example Detection via Temporal Imprints},
author = {Yansong Gao and Huaibing Peng and Hua Ma and Zhiyang Dai and Shuo Wang and Hongsheng Hu and Anmin Fu and Minhui Xue},
journal= {arXiv preprint arXiv:2503.04853},
year = {2025}
}