中文

UltraClean:一个训练鲁棒神经网络以抵御后门攻击的简单框架

密码学与安全 2025-12-05 v2

摘要

后门攻击是对深度神经网络的新兴威胁,通常通过注入中毒样本将恶意行为嵌入受害者模型中。攻击者可以通过在输入图像上呈现触发器,在推理期间激活注入的后门。先前的防御方法在对抗脏标签后门攻击(其中中毒样本的标签通常被错误标记)方面取得了显著成功。然而,这些方法对最近出现的一种新型后门——干净标签后门攻击——不起作用,该攻击难以察觉地修改中毒数据并保持标签一致。需要更复杂、更强大的算法来防御此类隐蔽攻击。在本文中,我们提出了 UltraClean,这是一个通用框架,简化了中毒样本的识别,并能防御脏标签和干净标签后门攻击。鉴于后门触发器引入的对抗性噪声在前向传播中会加剧的事实,UltraClean 首先使用现成的去噪函数生成训练样本的两个变体。然后,它利用 DNN 中的误差放大效应来衡量训练样本的易感性,该效应放大了原始图像与去噪变体之间的噪声差异。最后,它根据易感性过滤掉中毒样本,以阻止后门植入。尽管其很简单,UltraClean 在各种数据集上均实现了卓越的检测率,并在保持干净数据上良好模型准确率的同时,显著降低了后门攻击成功率,大幅优于现有防御方法。代码可在 https://github.com/bxz9200/UltraClean 获取。

关键词

引用

@article{arxiv.2312.10657,
  title  = {UltraClean: A Simple Framework to Train Robust Neural Networks against Backdoor Attacks},
  author = {Bingyin Zhao and Yingjie Lao},
  journal= {arXiv preprint arXiv:2312.10657},
  year   = {2025}
}