中文

OCGEC:用于DNN后门检测的单类图嵌入分类

机器学习 2024-04-09 v2 人工智能 密码学与安全

摘要

深度神经网络(DNNs)已被发现易受后门攻击,引发了对其在关键任务应用中部署的安全担忧。有多种检测后门攻击的方法,但它们都对目标攻击做出某些假设,并且需要数量相等且庞大的干净样本和后门样本进行训练,这使得这些检测方法在现实环境中相当受限。本研究提出一种新颖的单类分类框架,称为单类图嵌入分类(One-class Graph Embedding Classification, OCGEC),它使用GNNs进行模型级后门检测,仅需少量干净数据。首先,我们从少量干净数据集训练数千个微小模型作为原始数据集。随后,我们设计一种巧妙的模型到图(model-to-graph)方法,用于将模型的结构细节和权重特征转换为图数据。然后我们预训练一个生成式自监督图自编码器(GAE)以更好地学习良性模型的特征,从而无需知道攻击策略即可检测后门模型。之后,我们动态结合GAE和单类分类器的优化目标,形成区分后门模型与良性模型的分类边界。我们的OCGEC结合了图神经网络强大的表示能力与单类分类技术在异常检测领域的效用。与其他基线相比,它在多项任务上实现了超过98%的AUC分数,远超现有检测方法,即使后者依赖大量正负样本。我们将图场景用于通用后门检测的开创性应用可提供新的见解,用于改进其他后门防御任务。代码见 https://github.com/jhy549/OCGEC。

关键词

引用

@article{arxiv.2312.01585,
  title  = {OCGEC: One-class Graph Embedding Classification for DNN Backdoor Detection},
  author = {Haoyu Jiang and Haiyang Yu and Nan Li and Ping Yi},
  journal= {arXiv preprint arXiv:2312.01585},
  year   = {2024}
}

备注

v2