通过模型对齐提升对抗迁移性
机器学习
2024-07-18 v2 计算机视觉与模式识别
摘要
神经网络易受可在不同模型间迁移的对抗扰动影响。本文中,我们引入一种新颖的模型对齐技术,旨在提升给定源模型生成可迁移对抗扰动的能力。在对齐过程中,源模型的参数被微调以最小化一个对齐损失。该损失度量源模型与另一个独立训练的、称为见证模型的模型之间预测的分歧。为理解模型对齐的效果,我们对所得损失景观的变化进行了几何分析。在 ImageNet 数据集上使用多种模型架构的大量实验表明,由对齐源模型生成的扰动比原始源模型生成的扰动表现出显著更高的迁移性。
引用
@article{arxiv.2311.18495,
title = {Improving Adversarial Transferability via Model Alignment},
author = {Avery Ma and Amir-massoud Farahmand and Yangchen Pan and Philip Torr and Jindong Gu},
journal= {arXiv preprint arXiv:2311.18495},
year = {2024}
}
备注
Accepted at the European Conference on Computer Vision (ECCV) 2024. Code: https://github.com/averyma/model-alignment