关于显著性图与对抗鲁棒性
计算机视觉与模式识别
2020-07-14 v2 机器学习
摘要
最近出现了一个将可解释性概念与对抗鲁棒性结合起来的新趋势,这与早期仅专注于良好解释或对抗鲁棒性的工作不同。已有研究表明,经过对抗训练的模型比其非鲁棒对应模型展现出更具可解释性的显著性图,并且这种行为可以通过考虑输入图像与显著性图之间的对齐来量化。在这项工作中,我们为这种耦合提供了一个不同的视角,并提出了一种方法,即基于显著性的对抗训练(SAT),利用显著性图来提高模型的对抗鲁棒性。特别地,我们展示了使用数据集中已提供的标注,如边界框和分割掩码,作为弱显著性图,足以提高对抗鲁棒性,而无需额外努力来生成扰动本身。我们在 CIFAR-10、CIFAR-100、Tiny ImageNet 和 Flower-17 数据集上的实证结果一致证实了我们的主张,表明使用我们的方法提高了对抗鲁棒性。我们还展示了使用更精细、更强的显著性图如何导致更鲁棒的模型,以及将 SAT 与现有的对抗训练方法相结合如何进一步提升这些现有方法的性能。
引用
@article{arxiv.2006.07828,
title = {On Saliency Maps and Adversarial Robustness},
author = {Puneet Mangla and Vedant Singh and Vineeth N Balasubramanian},
journal= {arXiv preprint arXiv:2006.07828},
year = {2020}
}
备注
Accepted at ECML-PKDD 2020, Acknowledgements added