通过属性触发器实现干净标签的样本特定后门攻击
密码学与安全
2025-03-17 v3 人工智能
计算机视觉与模式识别
机器学习
摘要
当前,样本特定后门攻击(SSBA)是最先进且最恶意的方法,因为它们能轻易规避大多数现有的后门防御。在本文中,我们揭示了SSBA由于其毒化标签的特性而并非足够隐蔽,用户若检查图像-标签关系便能发现异常。具体而言,我们证明了通过仅毒化目标类别的样本,直接将现有SSBA泛化到其干净标签变体是无效的。我们揭示这主要源于两个原因,包括:(1)真实特征与触发特征的“拮抗效应”以及(2)样本特定特征的学习难度。相应地,现有SSBA的触发相关特征在干净标签设置下无法被有效学习,因为其确保隐蔽性所需的触发强度较为温和。我们认为,现有SSBA的强度约束主要是因为它们的触发模式是“内容无关”的,因此对人类和深度神经网络而言都表现为“噪声”。基于这一理解,我们提出利用内容相关特征,即(人类依赖的)属性,作为触发模式来设计干净标签的SSBA。这种新的攻击范式被称为属性触发后门攻击(BAAT)。我们在基准数据集上进行了大量实验,验证了BAAT的有效性及其对现有防御的抵抗力。
引用
@article{arxiv.2312.04584,
title = {Towards Sample-specific Backdoor Attack with Clean Labels via Attribute Trigger},
author = {Mingyan Zhu and Yiming Li and Junfeng Guo and Tao Wei and Shu-Tao Xia and Zhan Qin},
journal= {arXiv preprint arXiv:2312.04584},
year = {2025}
}
备注
This paper is accepted by IEEE Transactions on Dependable and Secure Computing (TDSC), 2025. The first two authors contributed equally to this work. 14 pages