中文

BDefects4NN:面向神经网络的后门缺陷数据库

软件工程 2024-12-03 v1

摘要

预训练的深度学习模型已成为下游中间件用户的主要组件,并彻底改变了从头本地训练的传统方法。为减少开发成本,开发者经常将来自第三方的预训练深度神经网络 (DNN) 集成到其智能软件系统中。然而,使用不可信的 DNN 可能存在显著的安全风险,因为这些模型可能包含来自黑箱训练过程的恶意后门缺陷。这些后门缺陷可通过隐藏触发器被激活,允许攻击者控制模型并损害智能软件的整体可靠性。为确保 DNN 在关键软件系统中的安全采用,建立后门缺陷数据库进行局部化研究至关重要。本文通过引入 BDefects4NN,第一个提供神经网络后门缺陷数据库,实现了以神经元粒度标记后门缺陷的 DNN,支持受控的缺陷根源局部化研究。在 BDefects4NN 中,我们定义了三个缺陷注入规则,并在四个主流网络架构和三个广泛采用的数据集上采用四种代表性后门攻击,构建了包含 1,654 个具有四种缺陷数量且感染神经元数量不同的后门缺陷 DNN。基于 BDefects4NN,我们对六种故障局部化准则和两种缺陷修复技术进行了大规模实验,结果显示这些方法对后门缺陷有效性有限。此外,我们研究了在自动驾驶中的车道检测和大型语言模型 (LLM) 中的后门缺陷模型,揭示了潜在威胁并凸显了当前精确缺陷局部化的局限性。

关键词

引用

@article{arxiv.2412.00746,
  title  = {BDefects4NN: A Backdoor Defect Database for Controlled Localization Studies in Neural Networks},
  author = {Yisong Xiao and Aishan Liu and Xinwei Zhang and Tianyuan Zhang and Tianlin Li and Siyuan Liang and Xianglong Liu and Yang Liu and Dacheng Tao},
  journal= {arXiv preprint arXiv:2412.00746},
  year   = {2024}
}

备注

11 pages, accepted by ICSE 2025