检测对抗样本——来自多媒体取证的经验
密码学与安全
2018-03-12 v1
摘要
对抗分类是在存在策略性攻击者的情形下执行鲁棒分类的任务。对抗分类起源于信息隐藏与多媒体取证,近来在更广泛的安全背景下受到大量关注。在基于机器学习的图像分类领域,对抗分类可解释为检测所谓的对抗样本,即良性图像的轻微改动版本。它们被专门构造,以使被攻击的分类器以极高概率将其误分类。在现代图像分类器中占主导的神经网络,已被证明尤其易受这些对抗样本的攻击。然而,检测数字图像中的细微改动一直是多媒体取证与隐写分析的目标。在本文中,我们强调这两个领域与安全机器学习之间的相似性。此外,我们调整了一种类似于早期隐写分析方法的线性滤波器,以检测由投影梯度下降(PGD)方法生成的对抗样本,PGD是该任务的最先进算法。我们在MNIST数据库上测试了我们的方法,并针对PGD的若干参数组合表明,我们的方法能够可靠地检测对抗样本。此外,对抗重训练与我们的检测方法的结合有效缩减了针对神经网络的攻击面。因此,我们得出结论:用于图像分类的对抗样本或许无法抵御来自隐写分析的检测方法,未来工作应探索多媒体取证中已知技术在其他对抗设定下的有效性。
引用
@article{arxiv.1803.03613,
title = {Detecting Adversarial Examples - A Lesson from Multimedia Forensics},
author = {Pascal Schöttle and Alexander Schlögl and Cecilia Pasquini and Rainer Böhme},
journal= {arXiv preprint arXiv:1803.03613},
year = {2018}
}
备注
Submitted to EUSIPCO 2018, Special Session on Adversarial Multimedia Forensics