中文

图像内认知后门模式的提取

机器学习 2023-09-14 v4 计算机视觉与模式识别

摘要

本文提出一种简单的方法来提取并检测图像内的后门模式:\emph{认知提取}(Cognitive Distillation, CD)。其思想是从输入图像中提取导致模型预测结果的“最小本质”。CD优化一个输入掩码,从输入图像中提取一个小模式,该模式能导致相同的模型输出(即logits或深层特征)。提取出的模式有助于理解模型在干净图像与后门图像上的认知机制,因此被称为\emph{认知模式}(Cognitive Pattern, CP)。利用CD和提取的CP,我们揭示了一个后门攻击的有趣现象:尽管不同攻击使用的触发模式形式和大小各异,后门样本的CP却都小得惊人且可疑。因此,可利用学习到的掩码从中毒训练数据集中检测并移除后门样本。我们进行了大量实验,表明CD能鲁棒地检测多种先进后门攻击。我们还展示了CD可潜在应用于帮助检测人脸数据集中的潜在偏差。代码见\url{https://github.com/HanxunH/CognitiveDistillation}。

关键词

引用

@article{arxiv.2301.10908,
  title  = {Distilling Cognitive Backdoor Patterns within an Image},
  author = {Hanxun Huang and Xingjun Ma and Sarah Erfani and James Bailey},
  journal= {arXiv preprint arXiv:2301.10908},
  year   = {2023}
}

备注

ICLR2023