通过对抗式关键调优评估神经网络鲁棒性
计算机视觉与模式识别
2024-01-09 v2 密码学与安全
机器学习
摘要
图像分类器的鲁棒性对其在现实世界中的部署至关重要。因此,评估其对训练数据操纵或偏差的抵御能力十分关键。这些修改传统上由仍能成功欺骗分类器的最小改动组成,而现代方法对这类改动日益鲁棒。因此,以有意义方式修改图像元素的语义操纵已在此用途上获得关注。然而,它们主要局限于风格、颜色或属性变化。尽管具表现力,这些操纵并未利用预训练生成模型的全部能力。在本工作中,我们旨在弥补这一差距。我们展示了如何使用预训练图像生成器以细致、多样且逼真的方式对图像进行语义操纵,同时保留原始图像的类。受近期基于 GAN 的图像反演方法启发,我们提出一种称为对抗式关键调优(APT)的方法。给定一幅图像,APT 首先利用预训练生成器找到重建该图像的关键潜在空间输入。然后它调整生成器权重以产生微小却语义性的操纵,从而欺骗预训练分类器。APT 保留了生成模型的全部表现性编辑能力。我们证明 APT 能够进行多种保留类别的语义图像操纵,欺骗各类预训练分类器。最后,我们展示对其他基准鲁棒的分类器对 APT 操纵并不鲁棒,并提出了一种改进方法。代码见:https://captaine.github.io/apt/
引用
@article{arxiv.2211.09782,
title = {Assessing Neural Network Robustness via Adversarial Pivotal Tuning},
author = {Peter Ebert Christensen and Vésteinn Snæbjarnarson and Andrea Dittadi and Serge Belongie and Sagie Benaim},
journal= {arXiv preprint arXiv:2211.09782},
year = {2024}
}
备注
Major changes include new experiments in Table 1 on page 5 and Table 2-4 on page 6, new figure 5 on page 8. Paper accepted at WACV (oral)