攻击贝叶斯:贝叶斯神经网络对抗鲁棒性研究
机器学习
2024-05-01 v1 人工智能
计算机视觉与模式识别
统计方法学
机器学习
摘要
对抗样本已被证明在广泛的视觉和语言任务中导致神经网络失效,但近期研究声称贝叶斯神经网络 (BNN) 本身对对抗扰动具有鲁棒性。本文考察了这一论点。为研究 BNN 的对抗鲁棒性,我们调查是否可能使用甚至相对不成熟的攻击方法成功破解最先进的 BNN 推理方法和预测管道,这些方法针对三个任务:(1)基于后验预测均值的标签预测,(2)基于贝叶斯预测不确定性的对抗样本检测,(3)语义漂移检测。我们发现,使用最先进的近似推断方法训练的 BNN,甚至使用 Hamiltonian Monte Carlo 训练的 BNN,都高度易受对抗攻击。我们还识别出之前声称 BNN 本身具备对抗鲁棒性的工作中存在的各种概念和实验错误,并最终证明 BNN 和不确定性感知的贝叶斯预测管道在对抗攻击下并非天然具备鲁棒性。
引用
@article{arxiv.2404.19640,
title = {Attacking Bayes: On the Adversarial Robustness of Bayesian Neural Networks},
author = {Yunzhen Feng and Tim G. J. Rudner and Nikolaos Tsilivis and Julia Kempe},
journal= {arXiv preprint arXiv:2404.19640},
year = {2024}
}