中文

DVERGE:通过多样化脆弱性增强集成模型的鲁棒生成

机器学习 2020-10-20 v2 密码学与安全 机器学习

摘要

近期研究发现用于图像分类的 CNN 模型表现出重叠的对抗脆弱性:对抗攻击可用微小扰动误导 CNN 模型,且这些攻击能有效迁移至在同一数据集上训练的不同模型。对抗训练作为一种通用的鲁棒性提升技术,通过迫使模型学习鲁棒特征来消除单一模型中的脆弱性。该过程困难,常需要大容量模型,并伴随干净数据准确率显著下降。作为替代,集成方法被提出以针对迁移对抗样本诱导具有多样化输出的子模型,使得集成即便在各子模型单独非鲁棒时也能抵御迁移攻击。该过程中仅观察到微小的干净准确率下降。然而,先前的集成训练方法在诱导此类多样性上效果不佳,因而难以实现鲁棒集成。我们提出 DVERGE,其通过蒸馏非鲁棒特征来隔离每个子模型中的对抗脆弱性,并使对抗脆弱性多样化以针对迁移攻击诱导多样化输出。新颖的多样性度量与训练过程使 DVERGE 相较于先前集成方法实现对迁移攻击更高的鲁棒性,并在向集成中添加更多子模型时获得改进的鲁棒性。本工作代码见 https://github.com/zjysteven/DVERGE

关键词

引用

@article{arxiv.2009.14720,
  title  = {DVERGE: Diversifying Vulnerabilities for Enhanced Robust Generation of Ensembles},
  author = {Huanrui Yang and Jingyang Zhang and Hongliang Dong and Nathan Inkawhich and Andrew Gardner and Andrew Touchet and Wesley Wilkes and Heath Berry and Hai Li},
  journal= {arXiv preprint arXiv:2009.14720},
  year   = {2020}
}

备注

To be appeared in NeurIPS 2020 conference (Oral)