NTD:基于非迁移性的后门检测
密码学与安全
2021-11-23 v1 人工智能
机器学习
摘要
后门深度学习(DL)模型在干净输入上表现正常,但在触发输入上按后门攻击者的意图出错,对 DL 模型部署造成严重后果。现有最先进的防御要么局限于特定后门攻击(与源无关的攻击),要么对用户不友好,需要机器学习(ML)专业知识或昂贵的计算资源。本工作观察到,所有现有后门攻击都有一个不可避免的内在弱点,即非迁移性:触发输入劫持一个被植入后门的模型,但无法对另一个未被植入相同后门的模型生效。基于这一关键观察,我们提出非迁移性赋能的后门检测(NTD),用于在运行时识别被测模型(MUT)的触发输入。具体而言,NTD 允许一个潜在被植入后门的 MUT 对输入预测一个类别。同时,NTD 利用一个特征提取器(FE)提取该输入以及从其预测类别中随机选取的一组样本的特征向量,然后在 FE 的潜空间中比较输入与样本的相似度。若相似度低,则该输入为对抗性触发输入;否则为良性。FE 是一个从开放平台 privately 保留的免费预训练模型。由于 FE 与 MUT 来源不同,攻击者极不可能向两者插入相同后门。因非迁移性,对 MUT 生效的触发效应无法迁移到 FE,使 NTD 能有效抵御不同类型后门攻击。我们在人脸识别、交通标志识别和通用动物分类三个流行定制任务上评估 NTD,结果证实 NDT 具有高有效性(低误接受率)和可用性(低误拒绝率)以及低检测延迟。
引用
@article{arxiv.2111.11157,
title = {NTD: Non-Transferability Enabled Backdoor Detection},
author = {Yinshan Li and Hua Ma and Zhi Zhang and Yansong Gao and Alsharif Abuadbba and Anmin Fu and Yifeng Zheng and Said F. Al-Sarawi and Derek Abbott},
journal= {arXiv preprint arXiv:2111.11157},
year = {2021}
}