中文

面向后门防御的剪枝重构:一种优化视角

神经元与认知 2025-01-22 v2

摘要

深度神经网络(DNN)已知 vulnerable to backdoor attacks,这构成了可靠部署的顾虑。最近的研究表明,通过剪枝特定神经元可消除感染的DNN中的后门,但如何有效识别和移除这些后门关联神经元仍是开放挑战。大多数现有防御方法依赖定义规则,仅关注神经元的局部属性,忽略了对剪枝策略的探索和优化。为此,我们提出一种结合图神经网络(GNN)和强化学习(RL)的优化神经元剪枝(ONP)方法,用于修复后门模型。具体而言,ONP首先将目标DNN建模为图,然后使用GNN基RL代理学习图嵌入并寻找合适的剪枝策略。到目前为止,这是首次尝试在后门防御领域运用GNN和RL来优化剪枝策略。实验表明,仅凭少量干净数据,ONP即可在轻微性能退化的代价下有效剪除由一组后门攻击植入的后门神经元,实现后门防御的新的SOTA性能。

关键词

引用

@article{arxiv.2405.17745,
  title  = {Shaping the distribution of neural responses with interneurons in a recurrent circuit model},
  author = {David Lipshutz and Eero P. Simoncelli},
  journal= {arXiv preprint arXiv:2405.17745},
  year   = {2025}
}