干净标签物理后门攻击:基于数据蒸馏
密码学与安全
2025-08-18 v4 人工智能
摘要
深度神经网络(DNN)显示出对后门投毒攻击的脆弱性,目前大量研究聚焦于数字触发器——即人为添加的用于诱导目标误分类的图像模式。物理触发器——嵌入真实场景中的自然物体——作为一种在无数字操控下实时激活后门的替代方案具有前景。然而,现有物理后门攻击均为脏标签(dirty-label),即必须修改被投毒输入的标签以匹配目标标签。内容与标签之间的不一致会暴露攻击行为,降低其在现实场景中的隐蔽性。为此,本文引入干净标签物理后门攻击(Clean-Label Physical Backdoor Attack, CLPBA)——一种无需标签操纵且无需在训练阶段注入触发器的后门攻击范式。攻击者仅需对少数目标类别样本注入不可感知的扰动即可实现模型后门。我们将攻击建模为数据蒸馏问题,提出三种 CLPBA 变体——参数匹配、梯度匹配和特征匹配——在线性探测和全参数微调训练设置下均能高效制造有效投毒。实验表明,在需满足物理世界后门泛化性的困难场景中,CLPBA 甚至优于脏标签攻击基线。我们通过在人脸识别和动物分类上收集的两个物理后门数据集进行大规模实验,验证了 CLPBA 的有效性。代码已公开于 https://github.com/thinh-dao/Clean-Label-Physical-Backdoor-Attacks。
引用
@article{arxiv.2407.19203,
title = {Clean-Label Physical Backdoor Attacks with Data Distillation},
author = {Thinh Dao and Khoa D Doan and Kok-Seng Wong},
journal= {arXiv preprint arXiv:2407.19203},
year = {2025}
}