中文

面向对抗后门攻击的贡献者感知防御

密码学与安全 2022-06-09 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

用于图像分类的深度神经网络众所周知易受对抗攻击。近来受到关注的一种此类攻击是对抗后门攻击,其已展现出对特定样本进行定向误分类的能力。具体而言,后门攻击试图迫使模型学习后门触发模式与错误标签之间的虚假关联。针对该威胁,已有众多防御措施被提出;然而,现有后门攻击防御聚焦于后门模式检测,面对新颖或意料之外的后门模式设计时可能并不可靠。我们引入了一种对抗场景的新重构视角:对抗者的存在隐式地意味着存在多个数据库贡献者。进而,在贡献者感知这一温和假设下,利用该知识通过破坏错误标签关联来防御后门攻击成为可能。我们提出了一种贡献者感知的通用防御框架,用于在存在多个潜在对抗数据源的情况下进行学习,该框架利用半监督集成与群体学习来过滤对抗触发所产生的错误标签。重要的是,该防御策略与后门模式设计无关,因其无需——亦不尝试——在训练或推理期间进行对抗者识别或后门模式检测。我们的实证研究证明了所提框架针对多个同时存在的对抗者的后门攻击的鲁棒性。

关键词

引用

@article{arxiv.2206.03583,
  title  = {Contributor-Aware Defenses Against Adversarial Backdoor Attacks},
  author = {Glenn Dawson and Muhammad Umer and Robi Polikar},
  journal= {arXiv preprint arXiv:2206.03583},
  year   = {2022}
}