中文

神经网络中的架构后门

机器学习 2022-06-17 v1 密码学与安全

摘要

机器学习易受对抗性操纵。已有文献表明,在训练阶段攻击者可以操纵数据及数据采样过程来控制模型行为。一个常见的攻击目标是植入后门,即迫使受害模型学会识别仅有攻击者知晓的触发器。在本文中,我们引入一类隐藏在模型架构中的新型后门攻击,即隐藏于用于训练的函数归纳偏置中。这些后门易于实现,例如通过发布他人会在不知情下复用的后门模型架构开源代码。我们证明模型架构后门构成真实威胁,并且与其他方法不同,其能在从头开始的完全重训练中存活。我们形式化了架构后门背后的主要构造原则,例如输入与输出之间的链接,并描述了一些可能的防护手段。我们在不同规模的计算机视觉基准上评估了我们的攻击,并证明该底层漏洞在多种训练设置中普遍存在。

关键词

引用

@article{arxiv.2206.07840,
  title  = {Architectural Backdoors in Neural Networks},
  author = {Mikel Bober-Irizar and Ilia Shumailov and Yiren Zhao and Robert Mullins and Nicolas Papernot},
  journal= {arXiv preprint arXiv:2206.07840},
  year   = {2022}
}