InverTune:通过触发器逆置与激活调优从多模态对比学习模型中移除后门
密码学与安全
2025-06-17 v1 计算机视觉与模式识别
摘要
多模态对比学习模型(如 CLIP)已展现出显著的视觉-语言对齐能力,但其对后门攻击的脆弱性带来了关键安全风险。攻击者可植入潜伏触发器,使其在后下游任务中持续存在,从而在触发器呈现时恶意控制模型行为。尽管近期防御机制取得了巨大成功,但由于对攻击者知识有较强假设或需要过多干净数据,它们仍不实用。本文提出 InverTune,这是首个在最小化攻击者假设下针对多模态模型的后门防御框架,既不需要先验知识关于攻击目标,也不需要访问被投毒数据集。与依赖投毒阶段所用数据集的现有防御方法不同,InverTune 通过三个关键组件有效识别并移除后门伪影,从而实现对后门攻击的鲁棒保护。具体而言,InverTune 首先通过对抗模拟暴露攻击特征,通过分析模型响应模式概率性地识别目标标签。在此基础上,我们开发了一种梯度逆置技术,通过激活模式分析来重建潜伏触发器。最后,采用聚类引导的微调策略,仅使用少量任意干净数据即可擦除后门功能,同时保留原始模型能力。实验结果表明,InverTune 在针对最先进(SOTA)攻击时将平均攻击成功率(ASR)降低了 97.87%,同时将干净准确率(CA)退化限制在仅 3.07%。本工作为保护多模态系统建立了新范式,在不牺牲性能的前提下推进基础模型部署的安全性。
引用
@article{arxiv.2506.12411,
title = {InverTune: Removing Backdoors from Multimodal Contrastive Learning Models via Trigger Inversion and Activation Tuning},
author = {Mengyuan Sun and Yu Li and Yuchen Liu and Bo Du and Yunjie Ge},
journal= {arXiv preprint arXiv:2506.12411},
year = {2025}
}