中文

从首要原则构建建构性神经后门

密码学与安全 2024-02-13 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

虽然之前的研究通过更改神经网络参数来植入后门,但近期的研究揭示了更隐蔽的威胁:嵌入在网络架构定义中的后门。这涉及向网络架构中注入诸如激活函数和池化层等常见构件,以微妙地引入持续性后门行为,即使在(完全重新)训练后也能保持。然而,建构性后门的完整范围和影响仍基本未被探索。Bober-Irizar 等人[2023]首次引入了建构性后门;他们展示了如何为棋盘格模式创建后门,但从未解释如何针对任意选择的触发器模式。本文构建了一个任意触发器检测器,可用于在无人工监督的情况下植入架构后门。这让我们得以重新审视建构性后门的概念并对其进行分类,描述12种不同的类型。为评估检测此类后门的难度,我们进行了用户研究,结果显示机器学习开发者仅能在37%的情况下识别常见模型定义中的可疑构件,而他们意外地在33%的情况下更倾向于选择植入后门的模型。为了阐释这些结果,我们发现语言模型在后门检测方面优于人类。最后,我们讨论了针对建构性后门的防御,强调需要稳健且全面的策略来保障机器学习系统的完整性。

关键词

引用

@article{arxiv.2402.06957,
  title  = {Architectural Neural Backdoors from First Principles},
  author = {Harry Langford and Ilia Shumailov and Yiren Zhao and Robert Mullins and Nicolas Papernot},
  journal= {arXiv preprint arXiv:2402.06957},
  year   = {2024}
}