NT-ML:基于非目标标签训练和相互学习的后门防御
机器学习
2025-08-08 v1
摘要
近期研究表明,深度神经网络 (DNN) 对后门攻击极其脆弱,攻击者可通过向数据集中注入设计好的触发器,当触发器被激活时,网络会进行错误预测。本文提出一种新型防御机制——非目标标签训练与相互学习 (NT-ML),成功恢复受高级后门攻击影响的模型。NT 通过使用标准训练输出来重新训练模型,以减少被毒化数据的损害。在此阶段,获得在干净数据上准确率高的教师模型,以及在毒化数据上对正确预测置信度更高的学生模型。随后,教师模型和学生模型可通过相互学习从各自的优势中汲取知识,以获得净化后的学生模型。大量实验表明,NT-ML 能有效防御 6 种后门攻击,仅需少量干净样本,还能超越 5 种最新后门防御方法。
引用
@article{arxiv.2508.05404,
title = {NT-ML: Backdoor Defense via Non-target Label Training and Mutual Learning},
author = {Wenjie Huo and Katinka Wolter},
journal= {arXiv preprint arXiv:2508.05404},
year = {2025}
}