中文

通过对抗权重掩码实现一次性神经后门擦除

机器学习 2022-11-03 v2 人工智能 密码学与安全

摘要

近期研究表明,尽管深度神经网络(DNNs)在诸多现实应用中取得了高准确率,它们仍可能被植入后门:通过将带触发器的数据样本注入训练数据集,只要呈现触发模式, adversary 就能误导训练后的模型将任意测试数据分类为目标类。为消除此类后门威胁,已有多种方法被提出。特别地,一系列研究旨在净化潜在被攻陷的模型。然而,这类工作的主要局限在于需要访问充足的原始训练数据:当可用训练数据有限时,净化性能大幅下降。本工作中,我们提出对抗权重掩码(AWM),一种即便在一次性设定下也能擦除神经后门的新方法。我们方法背后的核心思想是将该问题表述为一个极小极大优化问题:首先对抗性地恢复触发模式,随后(软)掩码对恢复出的模式敏感的网络权重。在多个基准数据集上的综合评估表明,相较于其他 SOTA 方法,AWM 在各种可用训练数据规模下均能大幅改善净化效果。

关键词

引用

@article{arxiv.2207.04497,
  title  = {One-shot Neural Backdoor Erasing via Adversarial Weight Masking},
  author = {Shuwen Chai and Jinghui Chen},
  journal= {arXiv preprint arXiv:2207.04497},
  year   = {2022}
}

备注

Accepted by NeurIPS 2022 (19 pages, 6 figures, 10 tables)