中文

利用高斯混合损失防御干净标签投毒

计算机视觉与模式识别 2020-03-03 v1

摘要

自 2014 年 Szegedy 等人表明对输入精心设计的扰动可令深度神经网络(DNNs)错误分类其标签以来,为使 DNN 更鲁棒于此类恶意扰动的研究持续进行。本工作中,我们考虑一种称为干净标签投毒攻击(CLPA)的投毒攻击。CLPA 的目标是注入看似良性的样本,其可剧烈改变 DNN 的决策边界,从而导致测试时的后续查询被误分类。我们主张,一种针对 CLPA 的强防御可在训练期间嵌入模型,通过迫使网络倒数第二层的特征遵循大间隔高斯混合(Large Margin Gaussian Mixture)分布实现。借助此类先验知识,我们可系统性地评估给定其所声称标签时该样本的不寻常程度。我们在 MNIST 与 CIFAR 数据集上通过实验展示了我们的内置防御。我们在每个数据集上训练两个模型:一个经 softmax 训练,另一个经 LGM 训练。我们表明,使用 LGM 可在无额外数据净化开销的情况下大幅降低 CLPA 的有效性。复现我们结果的代码已在线提供。

关键词

引用

@article{arxiv.2003.00798,
  title  = {Preventing Clean Label Poisoning using Gaussian Mixture Loss},
  author = {Muhammad Yaseen and Muneeb Aadil and Maria Sargsyan},
  journal= {arXiv preprint arXiv:2003.00798},
  year   = {2020}
}

备注

Preliminary v1