UnMask:通过对抗鲁棒特征对齐进行检测与防御
计算机视觉与模式识别
2020-11-17 v2 密码学与安全
机器学习
摘要
深度学习模型正被集成到从自动驾驶汽车到医疗诊断的广泛高影响、安全关键系统中。然而,近期研究已表明许多此类深度学习架构易受对抗攻击——凸显了在这些攻击发生前检测并缓解它们的防御技术的迫切需求。为对抗这些对抗攻击,我们开发了UnMask,一个基于鲁棒特征对齐的对抗检测与防御框架。UnMask的核心思想是通过验证图像的预测类别(“鸟”)包含预期的鲁棒特征(如喙、翅膀、眼睛)来保护这些模型。例如,若一幅图像被分类为“鸟”,但提取的特征是车轮、车座和车架,则该模型可能正遭受攻击。UnMask检测此类攻击,并通过纠正误分类、基于其鲁棒特征重新分类图像来防御模型。我们广泛的评估表明,UnMask(1)检测出多达96.75%的攻击,且(2)通过在灰盒设定下对当前最强攻击投影梯度下降(Projected Gradient Descent)生成的对抗图像正确分类多达93%来防御模型。UnMask在8个攻击向量上提供显著优于对抗训练的防护,平均准确率高出31.18%。我们随本文开源代码仓库与数据:https://github.com/safreita1/unmask。
引用
@article{arxiv.2002.09576,
title = {UnMask: Adversarial Detection and Defense Through Robust Feature Alignment},
author = {Scott Freitas and Shang-Tse Chen and Zijie J. Wang and Duen Horng Chau},
journal= {arXiv preprint arXiv:2002.09576},
year = {2020}
}
备注
Accepted into IEEE Big Data 2020