中文

面向少样本分类器抵御对抗支撑样本的一种概念简洁防御方法

机器学习 2021-10-26 v1 密码学与安全

摘要

少样本分类器已在用户提供标签稀缺的应用场景中展现出 promising 结果。这些模型仅通过在互不重叠的类别集上训练即可学习预测新类别。这很大程度上归因于其与常规深度网络相比机制上的差异。然而,这也给新型攻击者提供了对其他机器学习设定中不存在的此类模型发起完整性攻击的新机会。本工作中,我们旨在通过研究一种概念简洁的方法来防御少样本分类器免受对抗攻击,以弥补此差距。更具体地,我们提出一种简单的攻击无关检测方法,利用自相似性与滤波的概念,标记出破坏受害分类器对某一类别理解的对抗支撑集。我们在 miniImagenet (MI) 与 CUB 数据集上的扩展评估显示出良好的攻击检测性能,跨越三种不同少样本分类器及不同攻击强度,优于基线。我们观察到的 results 使我们的方法成为支撑集投毒攻击的一种强检测手段。我们还展示我们的方法构成一种可泛化概念,因其可与其他滤波函数配对。最后,我们针对检测方法中两个组件的变动提供了结果分析。

关键词

引用

@article{arxiv.2110.12357,
  title  = {Towards A Conceptually Simple Defensive Approach for Few-shot classifiers Against Adversarial Support Samples},
  author = {Yi Xiang Marcus Tan and Penny Chong and Jiamei Sun and Ngai-man Cheung and Yuval Elovici and Alexander Binder},
  journal= {arXiv preprint arXiv:2110.12357},
  year   = {2021}
}

备注

arXiv admin note: text overlap with arXiv:2012.06330