人脸误识别系统:简单权重操纵迫使深度神经网络仅对特定人出错
密码学与安全
2024-06-13 v2 机器学习
摘要
在本文中,我们描述了如何基于流行的深度连体神经网络架构在任何人脸识别模型中植入新型后门。这些后门迫使系统仅对攻击者预先选定的特定人物的自然图像出错,而无需控制其外观或插入任何触发器。例如,我们展示了这种后门系统如何将某个特定人物的任意两张图像分类为不同的人,或将某对特定人物的任意两张图像分类为同一个人,且对其他人决策的正确性几乎无影响。令人惊讶的是,我们展示了两类后门均可通过仅使用后门身份的图像,对模型的最后权重矩阵施加线性变换来实现,无需额外训练或优化。我们攻击的一个独特性质是,多个后门可由多个彼此可能不知晓对方存在的攻击者独立安装于同一模型中,且几乎无干扰。我们已在 SOTA 人脸识别系统上通过实验验证了这些攻击。当我们尝试对十位名人分别进行匿名化时,该网络在 到 的情况下未能将他们的两张图像识别为同一个人。例如,当我们尝试混淆外貌极其不同的 Morgan Freeman 和 Scarlett Johansson 时,他们的图像在 的情况下被判定为同一个人。对于每类后门,我们顺序安装了多个后门,彼此性能影响极小(例如,在同一模型上匿名化全部十位名人,使每位名人的成功率下降不超过 )。在所有实验中,网络对其他人的良性准确率几乎未退化(多数情况下下降小于 )。
引用
@article{arxiv.2301.03118,
title = {Facial Misrecognition Systems: Simple Weight Manipulations Force DNNs to Err Only on Specific Persons},
author = {Irad Zehavi and Roee Nitzan and Adi Shamir},
journal= {arXiv preprint arXiv:2301.03118},
year = {2024}
}
备注
21 pages. Added visualization, improved the MC backdoor, and added a method to avoid detection