图像与时间序列上的端到端反后门学习
机器学习
2024-01-09 v1 密码学与安全
摘要
后门攻击对深度学习模型构成了重大的安全隐患,尤其是那些用于关键安全和安保应用中的模型。这些攻击通过在训练阶段嵌入隐藏触发器来操纵模型行为,从而在推理阶段实现对模型输出的未经授权控制。尽管针对图像分类模型存在多种防御措施,但明显缺乏针对时间序列数据的防御措施,以及能够在受污染数据上训练干净模型的端到端解决方案。为填补这一空白,本文在反后门学习 (ABL) 的基础上,引入了一种创新方法——端到端反后门学习 (E2ABL),以实现对后门攻击的鲁棒训练。与采用两阶段训练过程的原始 ABL 不同,E2ABL 通过连接到深度神经网络 (DNN) 浅层的额外分类头实现了端到端训练。这个辅助头主动识别潜在的后门触发器,使模型能够在训练期间动态清洗这些样本及其对应的标签。我们的实验表明,E2ABL 显著优于现有防御措施,并且在图像和时间序列领域中对各种后门攻击均有效。
引用
@article{arxiv.2401.03215,
title = {End-to-End Anti-Backdoor Learning on Images and Time Series},
author = {Yujing Jiang and Xingjun Ma and Sarah Monazam Erfani and Yige Li and James Bailey},
journal= {arXiv preprint arXiv:2401.03215},
year = {2024}
}