多模态对比学习高效后门防御:基于令牌级遗忘的方法
密码学与安全
2024-10-01 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
多模态对比学习利用多种数据模态创建高质量特征,但其依赖大规模互联网数据源,使其易受到后门攻击的威胁。这些攻击在训练期间植入恶意行为,并在推理阶段通过特定触发器激活,构成重大的安全风险。尽管通过微调等既有防御措施已能降低此类攻击的恶意影响,但这些防御常需大量训练时间且会降低干净准确率。在本研究中,我们提出一种基于机器遗忘概念的高效防御机制,以应对后门威胁。这包括通过战略创建少量受污染样本来帮助模型快速遗忘后门漏洞,称为Unlearn Backdoor Threats(UBT)。我们具体采用过拟合训练来提高后门捷径,并准确检测潜在污染数据集中的可疑样本。随后,我们从可疑样本中选择更少的待遗忘样本进行快速遗忘,以消除后门效应,从而提升后门防御效率。在后门遗忘过程中,我们提出一种新颖的基于令牌的分部分离遗忘训练方案。该技术聚焦于模型的受损部分,解耦后门关联同时保持模型整体完整性。广泛的实验结果表明,我们的方法在CLIP模型上有效抵御了各种后门攻击方法。相较于当前最先进的后门防御方法,UBT在保持高模型干净准确率的同时,实现了最低的攻击成功率(攻击成功率降低19%,干净准确率提升2.57%)。
引用
@article{arxiv.2409.19526,
title = {Efficient Backdoor Defense in Multimodal Contrastive Learning: A Token-Level Unlearning Method for Mitigating Threats},
author = {Kuanrong Liu and Siyuan Liang and Jiawei Liang and Pengwen Dai and Xiaochun Cao},
journal= {arXiv preprint arXiv:2409.19526},
year = {2024}
}