中文

COLLIDER:一种针对后门数据的鲁棒训练框架

机器学习 2022-10-14 v1 计算机视觉与模式识别 机器学习

摘要

深度神经网络(DNN)分类器易受后门攻击。在此类攻击中,攻击者通过植入触发器来毒化部分训练数据,目的是使训练好的 DNN 在触发器被激活时输出攻击者期望的类别,而在干净数据上表现如常。近来已有多种方法被提出以检测恶意的带后门 DNN。然而,类似于对抗训练的鲁棒端到端训练方法,针对后门毒化数据尚待发现。本文中,我们通过开发一种鲁棒训练框架 COLLIDER 向此类方法迈出第一步,该框架利用数据底层的几何结构来筛选最具代表性的样本。具体而言,我们在每个训练轮次通过求解一个几何核集选择目标来有效过滤候选毒化数据。我们首先论证干净数据样本表现出(1)与干净多数数据相似的梯度,以及(2)较低的局部本征维数(LID)。基于这些准则,我们定义了一种新颖的核集选择目标来寻找此类样本,并将其用于训练 DNN。我们展示了所提方法在各种毒化数据集上鲁棒训练 DNN 的有效性,显著降低了后门成功率。

关键词

引用

@article{arxiv.2210.06704,
  title  = {COLLIDER: A Robust Training Framework for Backdoor Data},
  author = {Hadi M. Dolatabadi and Sarah Erfani and Christopher Leckie},
  journal= {arXiv preprint arXiv:2210.06704},
  year   = {2022}
}

备注

Accepted to the 16th Asian Conference on Computer Vision (ACCV 2022)