中文

遗忘后门威胁:通过局部令牌遗忘增强多模态对比学习中的后门防御

计算机视觉与模式识别 2024-03-26 v1

摘要

多模态对比学习已成为利用各种数据模态的互补优势构建高质量特征的强大范式。然而,此类系统的开放性无意中增加了后门攻击的可能性。这些攻击在训练期间巧妙地将恶意行为嵌入模型,这些行为可在推理阶段被特定触发器激活,构成重大安全风险。尽管现有的通过微调来减少此类攻击不利影响的对策存在,但这些防御措施通常会降低干净样本的准确率,并且需要构建大量的干净训练对。在本文中,我们从模型遗忘的角度探索了一种低成本防御的可能性,即是否可以通过构建一小部分中毒样本,使模型能够快速遗忘后门威胁(UBT)。具体来说,我们通过优先对弱相似性样本进行过拟合训练来强化后门捷径,从而发现可疑样本。在初步识别可疑样本的基础上,我们引入了一种创新的基于令牌的局部遗忘训练机制。该技术专门针对模型中被毒化的部分,集中精力遗忘后门关联,并尽量不损害整体模型的完整性。实验结果表明,我们的方法不仅确保了极低的攻击成功率,还保持了模型的高干净样本准确率。

关键词

引用

@article{arxiv.2403.16257,
  title  = {Unlearning Backdoor Threats: Enhancing Backdoor Defense in Multimodal Contrastive Learning via Local Token Unlearning},
  author = {Siyuan Liang and Kuanrong Liu and Jiajun Gong and Jiawei Liang and Yuan Xun and Ee-Chien Chang and Xiaochun Cao},
  journal= {arXiv preprint arXiv:2403.16257},
  year   = {2024}
}

备注

6 pages, 2 figures