中文

通过贝叶斯边界校正的训练后黑盒防御

计算机视觉与模式识别 2024-06-12 v3 密码学与安全

摘要

基于深度神经网络的分类器易受对抗攻击,这种广泛存在的脆弱性引发了防御潜在威胁的研究。给定一个脆弱的分类器,现有防御方法多为白盒,且常需要在修改后的损失函数/训练机制下对受害模型重新训练。而用户通常无法获得受害模型的模型/数据/训练细节,重新训练即便可能也缺乏吸引力,原因如计算资源有限。为此,我们提出一种新的训练后黑盒防御框架。它能在几乎不了解模型细节的情况下将任何预训练分类器转变为鲁棒分类器。这是通过对干净数据、对抗样本和分类器的新联合贝叶斯处理以最大化其联合概率实现的。它进一步配备了一种保持受害模型完好、避免重新训练的新训练后策略。我们将该框架命名为贝叶斯边界校正(BBC)。BBC是一个通用且灵活的框架,可轻松适配不同数据类型。我们针对图像分类和基于骨架的人体活动识别实例化了BBC,涵盖静态与动态数据。详尽评估表明,与现有防御方法相比,BBC具有更优的鲁棒性,且能在不严重损害干净准确率的情况下增强鲁棒性。

关键词

引用

@article{arxiv.2306.16979,
  title  = {Post-train Black-box Defense via Bayesian Boundary Correction},
  author = {He Wang and Yunfeng Diao},
  journal= {arXiv preprint arXiv:2306.16979},
  year   = {2024}
}

备注

arXiv admin note: text overlap with arXiv:2203.04713