鲁棒的特征级对手是可解释性工具
机器学习
2023-09-12 v7 人工智能
计算机视觉与模式识别
摘要
计算机视觉中对抗攻击的文献通常聚焦于像素级扰动。这类扰动往往极难解释。近期通过操控图像生成器的潜在表示来制造“特征级”对抗扰动的工作,为我们探索可感知、可解释的对抗攻击提供了机会。我们做出三点贡献。首先,我们观察到特征级攻击为研究模型中的表示提供了有用的输入类别。其次,我们表明这些对手具有独特的通用性与高度鲁棒性。我们证明它们可用于在 ImageNet 规模上产生定向、通用、伪装、物理可实现以及黑盒攻击。第三,我们展示了如何将这类对抗图像用作识别网络中缺陷的实用可解释性工具。我们利用这些对手预测特征与类别之间的虚假关联,随后通过设计“复制/粘贴”攻击(将一张自然图像粘贴到另一张中以引发定向误分类)进行检验。我们的结果表明,特征级攻击是一种有前景的严谨可解释性研究方法。它们支持设计工具以更好地理解模型所学内容并诊断脆弱的特征关联。代码见 https://github.com/thestephencasper/feature_level_adv
引用
@article{arxiv.2110.03605,
title = {Robust Feature-Level Adversaries are Interpretability Tools},
author = {Stephen Casper and Max Nadeau and Dylan Hadfield-Menell and Gabriel Kreiman},
journal= {arXiv preprint arXiv:2110.03605},
year = {2023}
}
备注
NeurIPS 2022, code available at https://github.com/thestephencasper/feature_level_adv