中文

探索鲁棒神经网络的误分类以增强对抗攻击

机器学习 2021-05-26 v2

摘要

尽管研究界付出了巨大努力,使神经网络对对抗攻击更具鲁棒性的进展大多微不足道。此外,鲁棒性评估常不精确,难以识别有前景的方法。我们分析了 19 种不同最先进神经网络的分类决策,这些网络被训练为对对抗攻击鲁棒。我们的发现表明,当前无目标对抗攻击仅诱导朝向有限数量不同类别的误分类。此外,我们观察到模型预测中过度自信与欠自信均导致对模型鲁棒性的不准确评估。基于这些观察,我们提出了一种用于对抗攻击的新损失函数,与先前的损失函数相比,在所分析的 19 个模型中一致地提高了攻击成功率(19 个中的 19 个)。

关键词

引用

@article{arxiv.2105.10304,
  title  = {Exploring Misclassifications of Robust Neural Networks to Enhance Adversarial Attacks},
  author = {Leo Schwinn and René Raab and An Nguyen and Dario Zanca and Bjoern Eskofier},
  journal= {arXiv preprint arXiv:2105.10304},
  year   = {2021}
}