中文

UNICORN:一种统一的后门触发器反演框架

机器学习 2023-04-07 v1 人工智能 密码学与安全 计算机视觉与模式识别

摘要

后门攻击是指 adversary 利用带有触发器(如补丁)的输入来激活预先植入的恶意行为,这对深度神经网络(DNN)模型是严重威胁。触发器反演是识别后门模型并理解所嵌入对抗行为的有效手段。触发器反演的一个挑战在于构造触发器的方式多种多样。现有方法通过做出某些假设或针对特定攻击的约束,无法泛化到各类触发器。其根本原因在于现有工作在反演问题形式化中未考虑触发器的设计空间。本文正式定义并分析了注入不同空间的触发器及反演问题。进而,基于触发器的形式化及我们从分析中识别出的后门模型内在行为,提出了一种统一的后门触发器反演框架。我们的原型系统 UNICORN 通用且能有效地反演 DNN 中的后门触发器。代码可在 https://github.com/RU-System-Software-and-Security/UNICORN 获取。

关键词

引用

@article{arxiv.2304.02786,
  title  = {UNICORN: A Unified Backdoor Trigger Inversion Framework},
  author = {Zhenting Wang and Kai Mei and Juan Zhai and Shiqing Ma},
  journal= {arXiv preprint arXiv:2304.02786},
  year   = {2023}
}