中文

视觉-语言模型中有效的后门缓解依赖于预训练目标

机器学习 2025-01-14 v4 人工智能 计算机视觉与模式识别

摘要

尽管当代机器学习(ML)模型能力先进,它们仍易受对抗攻击与后门攻击。该脆弱性在实际部署中尤为令人担忧,因为被攻陷的模型可能在关键场景中表现出不可预测的行为。由于多模态模型训练普遍采用从互联网收集的大规模数据集,而这些数据集可能藏有后门,此类风险进一步加剧。已有多种技术被提出用于缓解多模态模型中的后门影响,如CleanCLIP,其为当前最先进(SOTA)方法。本工作中,我们证明CleanCLIP缓解后门的效果高度依赖于模型预训练所用的特定目标。我们观察到,导致更高零样本分类性能的更强预训练目标,与更难去除的后门行为相关。我们通过在两个分别含300万(CC3M)和600万(CC6M)数据点的大型数据集上,以多种预训练目标训练多模态模型,随后使用CleanCLIP进行毒药去除,展示了上述现象。我们发现,即便经过大量超参数调优,当使用更强的预训练目标时,CleanCLIP在毒药去除上仍无效。我们的发现为使用大规模网络整理数据训练模型且关注潜在后门威胁的ML从业者强调了关键考量。

关键词

引用

@article{arxiv.2311.14948,
  title  = {Effective Backdoor Mitigation in Vision-Language Models Depends on the Pre-training Objective},
  author = {Sahil Verma and Gantavya Bhatt and Avi Schwarzschild and Soumye Singhal and Arnav Mohanty Das and Chirag Shah and John P Dickerson and Pin-Yu Chen and Jeff Bilmes},
  journal= {arXiv preprint arXiv:2311.14948},
  year   = {2025}
}

备注

Accepted at TMLR (https://openreview.net/forum?id=Conma3qnaT)