MultiGuard:针对对抗样本的可证明鲁棒多标签分类防御
密码学与安全
2022-10-04 v1 机器学习
摘要
多标签分类可预测输入的一组标签,具有诸多应用。然而,多项近期研究表明多标签分类易受对抗样本攻击。具体而言,攻击者可通过向输入添加精心构造、人类难以察觉的扰动,操纵多标签分类器对输入预测的标签。现有面向多类分类的可证明防御在推广至多标签分类时获得次优的可证明鲁棒性保证。本工作中,我们提出MultiGuard,首个针对多标签分类对抗样本的可证明鲁棒防御。我们的MultiGuard利用随机平滑——构建可证明鲁棒分类器的最先进(SOTA)技术。具体地,给定任意多标签分类器,我们的MultiGuard通过向输入添加随机噪声构建平滑多标签分类器。本工作考虑各向同性高斯噪声。我们的主要理论贡献在于,当添加至输入的对抗扰动的 范数有界时,我们证明输入的一定数量的真实标签可证明地位于我们的MultiGuard预测的标签集合中。此外,我们设计了一种算法以计算我们的可证明鲁棒性保证。在实证上,我们在VOC 2007、MS-COCO与NUS-WIDE基准数据集上评估我们的MultiGuard。我们的代码见于:\url{https://github.com/quwenjie/MultiGuard}
引用
@article{arxiv.2210.01111,
title = {MultiGuard: Provably Robust Multi-label Classification against Adversarial Examples},
author = {Jinyuan Jia and Wenjie Qu and Neil Zhenqiang Gong},
journal= {arXiv preprint arXiv:2210.01111},
year = {2022}
}
备注
Accepted by NeurIPS 2022