安全迁移学习:针对预训练编码器和下游数据集中的后门进行干净模型训练
机器学习
2025-04-17 v1 密码学与安全
摘要
从预训练编码器进行迁移学习已成为现代机器学习中的 essential 手段,使能够高效地跨越各种任务进行模型适应。然而,这种预训练和下游适应的组合方式扩大了攻击面,使模型暴露于来自编码器和数据集水平的高级后门嵌入——这一领域通常被忽视。此外,可供预训练编码器用户的有限计算资源限制了通用后门防御相对于从头开始的端到端训练的有效性。在本工作中,我们调查如何在资源受限的迁移学习场景中缓解潜在的后门风险。具体而言,我们对现有防御策略进行详尽分析,发现许多防御策略遵循基于假设的反应式工作流程,这些假设在面对未知威胁、新攻击类型或不同训练范式时难以扩展。作为回应,我们引入一种以识别干净元素为焦点的主动方法,并提出Trusted Core(T-Core)引导框架,强调确定可信赖数据和神经元以增强模型安全性的重要性。我们的实证评估表明T-Core的有效性和优越性,具体评估了5种编码器投毒攻击、7种数据集投毒攻击和14种基线防御,涵盖5个基准数据集,针对4种可能的后门威胁情景。
引用
@article{arxiv.2504.11990,
title = {Secure Transfer Learning: Training Clean Models Against Backdoor in (Both) Pre-trained Encoders and Downstream Datasets},
author = {Yechao Zhang and Yuxuan Zhou and Tianyu Li and Minghui Li and Shengshan Hu and Wei Luo and Leo Yu Zhang},
journal= {arXiv preprint arXiv:2504.11990},
year = {2025}
}
备注
To appear at IEEE Symposium on Security and Privacy 2025, 20 pages