防御深度回归模型中的后门攻击
机器学习
2024-11-08 v1 人工智能
摘要
深度回归模型广泛用于多种安全关键应用,但容易受到后门攻击。尽管已有许多针对分类模型的防御方法,但它们因未考虑回归模型的独特性而无效。首先,回归模型的输出是连续值而非离散标签,因此被后门感染的回归模型目标具有无限可能性,使得现有防御方法无法确定。其次,后门深度回归模型的后门行为由特征空间中所有神经元的激活值触发,这使得使用现有防御方法难以检测和缓解。为解决这些问题,我们提出DRMGuard——首个用于判断图像域深度回归模型是否被后门植入的防御方法。DRMGuard基于后门深度回归模型独特的输出空间和特征空间特性,构建了逆向工程的优化问题。我们在两个回归任务和四个数据集上进行了广泛评估。结果表明DRMGuard能够持续防御各种后门攻击。我们还将四种针对分类器设计的最先进防御方法推广到回归模型,并与DRMGuard进行了比较。结果表明DRMGuard显著优于所有这些防御方法。
引用
@article{arxiv.2411.04811,
title = {Defending Deep Regression Models against Backdoor Attacks},
author = {Lingyu Du and Yupei Liu and Jinyuan Jia and Guohao Lan},
journal= {arXiv preprint arXiv:2411.04811},
year = {2024}
}