基于扩散模型的语义对抗性补丁生成用于黑盒人脸识别模型
计算机视觉与模式识别
2025-02-28 v1 密码学与安全
摘要
鉴于评估人脸识别(FR)模型鲁性的需求,许多研究聚焦于通过引入局部扰动来误导 FR 模型的对抗性补丁攻击。冒充攻击因其允许攻击者伪装成合法用户而构成重大威胁,可能导致数据泄露、系统损坏和资源滥用等严重后果。然而,FR 领域此类攻击的研究仍有限。现有对抗性补丁生成方法在冒充攻击中表现有限,主要原因包括:(1)攻击者能力需求高、(2)攻击成功率低、(3)查询次数过多。为解决这些挑战,我们提出一种新方法 SAP-DIFF,通过在潜在空间内进行语义扰动来生成对抗性补丁,而非直接进行像素操作。我们引入注意力干扰机制以生成与原人脸无关的特征,从而促进对抗样本的创建;同时设计方向性损失函数引导扰动导向目标身份特征空间,从而提升攻击效果和效率。广泛的实验在流行的 FR 模型和数据集上表明,我们的方法在状态机方法中 outperform,平均攻击成功率提升 45.66%(所有指标均超过 40%),查询次数约减少 40%。
引用
@article{arxiv.2502.19710,
title = {SAP-DIFF: Semantic Adversarial Patch Generation for Black-Box Face Recognition Models via Diffusion Models},
author = {Mingsi Wang and Shuaiyin Yao and Chang Yue and Lijie Zhang and Guozhu Meng},
journal= {arXiv preprint arXiv:2502.19710},
year = {2025}
}