通过重构潜在表示中的触发器激活变化实现鲁棒的后门删除
机器学习
2025-11-13 v1 密码学与安全
摘要
后门攻击构成对机器学习模型的严重威胁,导致其在干净数据上正常工作,但在被毒化数据上误分类为毒化类别。现有防御方法常试图基于触发器激活变化(TAC)识别并删除后门神经元,TAC 是干净数据与被毒化数据之间激活差异。这些方法因 TAC 值估计不准而难以精确识别真实后门神经元。本文提出一种新方法,通过准确重构潜在表示中的 TAC 值来实现后门删除。具体而言,我们将迫使干净数据被分类为特定类别的最小扰动形式化为凸二次优化问题,其最优解作为 TAC 的替代品。随后,我们通过检测扰动的 L2 范数统计学较小值来识别被毒化类别,并利用该类别的扰动进行微调以删除后门。在 CIFAR-10、GTSRB 和 TinyImageNet 上的实验表明,我们的方法在不同攻击类型、数据集和架构之间始终实现优异的后门抑制,同时保持高的干净准确率,超越现有防御方法。
引用
@article{arxiv.2511.08944,
title = {Robust Backdoor Removal by Reconstructing Trigger-Activated Changes in Latent Representation},
author = {Kazuki Iwahana and Yusuke Yamasaki and Akira Ito and Takayuki Miura and Toshiki Shibahara},
journal= {arXiv preprint arXiv:2511.08944},
year = {2025}
}