通过多样性训练提升集成模型的对抗鲁棒性
机器学习
2019-01-30 v1 机器学习
摘要
深度神经网络即使在攻击者无法直接访问被攻击模型的设置下,也易受对抗攻击。此类攻击通常依赖于可迁移性原则,即针对替代模型构造的攻击往往能迁移到目标模型。我们表明,具有未对齐损失梯度的模型集成可针对基于迁移的攻击提供有效防御。我们的核心见解是:若集成中各模型的损失函数不以相关方式增长,则对抗样本不太可能同时欺骗多个模型。为此,我们提出多样性训练(Diversity Training),一种训练具有不相关损失函数的模型集成的新方法。我们表明,我们的方法显著提升了集成的对抗鲁棒性,并且也可与现有方法结合以构建更强的防御。
引用
@article{arxiv.1901.09981,
title = {Improving Adversarial Robustness of Ensembles with Diversity Training},
author = {Sanjay Kariyappa and Moinuddin K. Qureshi},
journal= {arXiv preprint arXiv:1901.09981},
year = {2019}
}