中文

TrojanZoo:面向统一、整体且实用的神经后门评估

机器学习 2022-10-24 v4

摘要

神经后门是深度学习系统安全的主要威胁之一。密集的研究已产生大量后门攻击/防御,导致持续的军备竞赛。然而,由于缺乏评估基准,许多关键问题仍未充分探索:(i)不同攻击/防御的优缺点是什么?(ii)操作它们的最佳实践是什么?(iii)现有攻击/防御如何进一步改进?为弥补这一差距,我们设计并实现了TROJANZOO,首个以统一、整体且实用方式评估神经后门攻击/防御的开源平台。迄今,它聚焦于计算机视觉领域,已集成8种代表性攻击、14种最先进防御、6种攻击性能度量、10种防御效用度量,以及用于深入分析了攻击-防御交互的丰富工具。借助TROJANZOO,我们对现有攻击/防御进行了系统研究,揭示了它们复杂的设计谱系:均展现出在多个期望属性(如攻击的有效性、规避性和迁移性)之间的精细权衡。我们进一步探索改进现有攻击/防御,得出若干有趣发现:(i)单像素触发器通常已足够;(ii)从头训练常优于扰动良性模型以制作木马模型;(iii)联合优化触发器和木马模型极大提升了攻击有效性与规避性;(iv)个体防御常可被自适应攻击规避;(v)利用模型可解释性显著提升防御鲁棒性。我们期望TROJANZOO将作为促进未来神经后门研究的宝贵平台。

关键词

引用

@article{arxiv.2012.09302,
  title  = {TrojanZoo: Towards Unified, Holistic, and Practical Evaluation of Neural Backdoors},
  author = {Ren Pang and Zheng Zhang and Xiangshan Gao and Zhaohan Xi and Shouling Ji and Peng Cheng and Xiapu Luo and Ting Wang},
  journal= {arXiv preprint arXiv:2012.09302},
  year   = {2022}
}

备注

Accepted as a full paper at EuroS&P 2022