中文

论贝叶斯神经网络对对抗攻击的鲁棒性

机器学习 2024-02-29 v3 人工智能 密码学与安全

摘要

对对抗攻击的脆弱性是深度学习在安全关键应用中部署的主要障碍之一。尽管在实践和理论方面付出了巨大努力,训练对对抗攻击鲁棒的深度学习模型仍是一个开放问题。在本文中,我们在大数据、过参数化极限下分析了贝叶斯神经网络(BNNs)中对抗攻击的几何性质。我们表明,在该极限下,对基于梯度的攻击的脆弱性源于数据分布的退化,即数据位于环境空间的低维子流形上时。作为直接后果,我们证明了在此极限下BNN后验对基于梯度的对抗攻击是鲁棒的。关键的是,我们证明了相对于BNN后验分布的损失期望梯度是消失的,即使从后验中采样的每个神经网络都对基于梯度的攻击脆弱。在代表有限数据机制的MNIST、Fashion MNIST和half moons数据集上,使用哈密顿蒙特卡洛与变分推断训练的BNN的实验结果支持了上述论点,表明BNN能在干净数据上展现高准确率,并对基于梯度和无梯度对抗攻击均具鲁棒性。

关键词

引用

@article{arxiv.2207.06154,
  title  = {On the Robustness of Bayesian Neural Networks to Adversarial Attacks},
  author = {Luca Bortolussi and Ginevra Carbone and Luca Laurenti and Andrea Patane and Guido Sanguinetti and Matthew Wicker},
  journal= {arXiv preprint arXiv:2207.06154},
  year   = {2024}
}

备注

arXiv admin note: text overlap with arXiv:2002.04359