基于拓扑演化动力学的深度学习鲁棒后门检测
密码学与安全
2023-12-06 v1
摘要
深度学习中的后门攻击在模型中植入隐藏后门,以在特定输入模式下触发恶意行为。现有检测方法假设存在一个度量空间(针对原始输入或其潜在表示),在该空间中正常样本与恶意样本是可分的。我们通过引入一种新颖的 SSDT(Source-Specific and Dynamic-Triggers,特定源与动态触发器)后门来表明该假设具有严重局限性,该后门模糊了正常样本与恶意样本之间的差异。为克服这一局限,我们不再寻找适用于不同深度学习模型的完美度量空间,而是诉诸更鲁棒的拓扑结构。我们提出 TED(Topological Evolution Dynamics,拓扑演化动力学)作为鲁棒后门检测中与模型无关的基础。TED 的核心思想是将深度学习模型视为一个将输入演化至输出的动力系统。在此动力系统中,良性输入遵循与其他良性输入相似的自然演化轨迹。相反,恶意样本表现出截然不同的轨迹,因为它起初接近良性样本,但最终转向攻击者指定目标样本的邻域以激活后门。在不同网络架构的视觉和自然语言数据集上进行了广泛评估。结果表明,TED 不仅实现了高检测率,而且显著优于现有 SOTA 检测方法,特别是在应对复杂的 SSDT 攻击方面。用于复现结果的代码已在 GitHub 上公开。
引用
@article{arxiv.2312.02673,
title = {Robust Backdoor Detection for Deep Learning via Topological Evolution Dynamics},
author = {Xiaoxing Mo and Yechao Zhang and Leo Yu Zhang and Wei Luo and Nan Sun and Shengshan Hu and Shang Gao and Yang Xiang},
journal= {arXiv preprint arXiv:2312.02673},
year = {2023}
}
备注
18 pages. To appear in IEEE Symposium on Security and Privacy 2024