选择性遗忘:木马化机器学习模型中后门效应的高效、高保真与盲抑制
机器学习
2024-08-13 v2 人工智能
密码学与安全
计算机视觉与模式识别
摘要
本文中,我们提出一种简单却出奇有效的技术,以在已植入后门的模型上诱导“选择性遗忘”。我们的方法称为 SEAM,其灵感来自灾难性遗忘(CF)问题——持续学习中长期存在的难题。我们的思路是在随机标注的干净数据上重新训练给定的 DNN 模型,以在模型上诱发 CF,导致主任务与后门任务均被突然遗忘;随后我们在正确标注的干净数据上重新训练该随机化模型以恢复主任务。我们将 SEAM 建模为持续学习下的遗忘过程,并进一步用神经正切核近似 DNN 以度量 CF,从而进行分析。我们的分析表明,在缺乏触发输入的情况下,随机标注方法实际上最大化了对未知后门的 CF,并保留网络中的部分特征提取能力以实现主任务的快速复原。我们进一步在图像处理与自然语言处理任务上评估 SEAM,涵盖数据污染与训练操纵攻击,涉及数千个或在流行图像数据集上训练的、或由 TrojAI 竞赛提供的模型。实验表明,SEAM 大幅优于最先进(SOTA)的遗忘技术,在几分钟内(约比用 MNIST 数据集从零训练模型快 30 倍)实现高保真度(衡量主任务准确率与后门准确率之间的差距),且仅需少量干净数据(TrojAI 模型的训练数据的 0.1%)。
引用
@article{arxiv.2212.04687,
title = {Selective Amnesia: On Efficient, High-Fidelity and Blind Suppression of Backdoor Effects in Trojaned Machine Learning Models},
author = {Rui Zhu and Di Tang and Siyuan Tang and XiaoFeng Wang and Haixu Tang},
journal= {arXiv preprint arXiv:2212.04687},
year = {2024}
}