PBP:面向恶意软件分类器的后训练后门净化
机器学习
2026-02-13 v4 人工智能
密码学与安全
摘要
近年来,机器学习 (ML) 在网络安全中的应用带来了新的挑战,包括恶意软件分类器上日益增加的后门投毒攻击威胁。例如,攻击者可能将恶意样本注入公共恶意软件存储库,使训练数据被污染,进而导致 ML 模型对恶意软件进行误分类。当前的对策主要 focus on 通过利用 ensemble 模型在训练数据点上输出不一致性来检测被投毒的样本。然而,这些方法不适用于 Machine Learning-as-a-Service (MLaaS) 的场景,或当用户希望在模型训练后去除后门时。为此,我们引入 PBP,这是一种针对恶意软件分类器的后训练防御方法,可在不假设特定后门嵌入机制的情况下缓解各种类型的后门嵌入。我们的 method 利用后门攻击对神经网络激活分布的影响,独立于触发器嵌入方法。在存在后门攻击时,网络各层的激活分布被扭曲为混合分布。通过调节 batch normalization 层的统计信息,我们可以引导受后门影响的模型在性能上类似于干净的模型。我们的 method 在两个数据集、两种后门方法以及各种攻击配置的实验中均显示出比多个最先进方法的显著优势。值得注意的是,我们的方法只需要训练数据的极小一部分——仅 1%——即可净化后门并将攻击成功率从 100% 降低至几乎 0%,相较于 baseline 方法提升了 100 倍。我们的代码已公开于 https://github.com/judydnguyen/pbp-backdoor-purification-official。
引用
@article{arxiv.2412.03441,
title = {PBP: Post-training Backdoor Purification for Malware Classifiers},
author = {Dung Thuy Nguyen and Ngoc N. Tran and Taylor T. Johnson and Kevin Leach},
journal= {arXiv preprint arXiv:2412.03441},
year = {2026}
}
备注
The Network and Distributed System Security (NDSS) Symposium 2025