理解可迁移对抗攻击中的模型集成
机器学习
2025-05-29 v3 人工智能
摘要
模型集成对抗攻击已成为生成能够针对甚至未知模型的可迁移对抗样本的强大方法,但其理论基础仍未得到充分探索。为弥补这一差距,我们提供了早期的理论见解,为推进模型集成对抗攻击提供路线图。我们首先定义可迁移性误差,以衡量对抗可迁移性的误差,并提出多样性和经验模型集成 Rademacher 复杂度的概念。随后,我们将可迁移性误差分解为脆弱性、多样性和常数项,从而严格解释了模型集成攻击中可迁移性误差的来源:对抗样本对集成组件的脆弱性,以及集成组件的多样性。进一步,我们运用信息论中的最新数学工具,对可迁移性误差进行上界,涉及复杂度和泛化项,从而贡献三个实际指南以降低可迁移性误差:(1) 纳入更多代理模型,(2) 增加其多样性,(3) 在出现过拟合时降低其复杂度。最后,基于 54 个模型的大量实验验证了我们的理论框架,标志着对可迁移模型集成对抗攻击理解的重大进步。
关键词
引用
@article{arxiv.2410.06851,
title = {Understanding Model Ensemble in Transferable Adversarial Attack},
author = {Wei Yao and Zeliang Zhang and Huayi Tang and Yong Liu},
journal= {arXiv preprint arXiv:2410.06851},
year = {2025}
}
备注
Accepted by ICML 2025