中文

多模态大语言模型微调中的后门清除无需外部引导

密码学与安全 2025-05-23 v1 计算机视觉与模式识别

摘要

多模态大语言模型(MLLM)越来越多地被部署在微调即服务(FTaaS)场景中,用户提交的数据集将通用模型适配到下游任务。然而,这种灵活性引入了严重的安全风险,因为恶意微调可以几乎不费力地向 MLLM 中植入后门。在本文中,我们观察到后门触发器通过导致对非语义区域的异常注意力集中来系统性地破坏跨模态处理——我们将其称为注意力崩溃。基于这一洞察,我们提出 Believe Your Eyes(BYE),一个数据过滤框架,利用注意力熵模式作为自监督信号来识别和过滤后门样本。BYE 通过三阶段流水线运行:(1)使用微调后的模型提取注意力图,(2)计算熵分数并通过双模分离刻画敏感层,(3)执行无监督聚类以移除可疑样本。与先前的防御方法不同,BYE 不需要干净的监督、辅助标签或模型修改。在各种数据集、模型和多样化触发类型上的大量实验验证了 BYE 的有效性:它在保持干净任务性能的同时实现了接近零的攻击成功率,为 MLLM 中的后门威胁提供了鲁棒且可泛化的解决方案。

关键词

引用

@article{arxiv.2505.16916,
  title  = {Backdoor Cleaning without External Guidance in MLLM Fine-tuning},
  author = {Xuankun Rong and Wenke Huang and Jian Liang and Jinhe Bi and Xun Xiao and Yiming Li and Bo Du and Mang Ye},
  journal= {arXiv preprint arXiv:2505.16916},
  year   = {2025}
}