中文

基于通道 Lipschitz 性质的无数据后门去除

机器学习 2022-11-29 v2 密码学与安全

摘要

近期研究表明,深度神经网络(DNNs)易受后门攻击,当特定触发器附着于输入图像时会导致 DNNs 的恶意行为。进一步证明,受感染的 DNNs 拥有一组相较于正常通道对后门触发器更敏感的通道。随后表明剪枝这些通道可有效缓解后门行为。为定位这些通道,自然地可考虑其 Lipschitz 性质,该性质度量其对输入最坏情况扰动的敏感度。在本工作中,我们引入称为通道 Lipschitz 常数(CLC)的新概念,其定义为从输入图像到各通道输出的映射的 Lipschitz 常数。随后我们提供经验证据,表明 CLC 的上界(UCLC)与触发器激活的通道激活变化之间存在强相关性。由于 UCLC 可直接由权重矩阵计算,我们能以无数据方式检测潜在后门通道,并对受感染 DNN 进行简单剪枝以修复模型。所提出的基于通道 Lipschitz 性质的剪枝(CLP)方法极快、简单、无数据且对剪枝阈值的选择具有鲁棒性。我们进行了大量实验以评估 CLP 的效率和有效性,其在主流防御方法中即使无任何数据也达到了最先进结果。源代码见 https://github.com/rkteddy/channel-Lipschitzness-based-pruning。

关键词

引用

@article{arxiv.2208.03111,
  title  = {Data-free Backdoor Removal based on Channel Lipschitzness},
  author = {Runkai Zheng and Rongjun Tang and Jianze Li and Li Liu},
  journal= {arXiv preprint arXiv:2208.03111},
  year   = {2022}
}

备注

Accepted to ECCV 2022