中文

TCAP:用于 MLLM 微调中无监督后门检测的三组件注意力剖析

人工智能 2026-05-25 v2

摘要

FTaaS(Fine-Tuning-as-a-Service)促进了多模态大语言模型(MLLM)的定制化,但通过受毒化数据影响引入了关键后门风险。现有防御方法要么依赖监督信号,要么无法在不同触发类型和模态之间普遍适用。本文发现一种通用的后门指纹——注意力分配偏差:无论触发 morphology 如何,受毒样本都会破坏系统指令、视觉输入和用户文本查询三个功能组件之间平衡注意力分布。针对这一洞察,我们提出了三组件注意力剖析(TCAP),一种用于过滤后门样本的无监督防御框架。TCAP 将跨模态注意力图分解为三个组件,通过高斯混合模型(GMM)统计剖析识别触发响应注意力头,并通过基于 EM 的投票聚合隔离受毒样本。广泛的实验在不同的 MLLM 架构和攻击方法上都表现出一致良好的性能,证明 TCAP 是 MLLM 中稳健且实用的后门防御方法。

关键词

引用

@article{arxiv.2601.21692,
  title  = {TCAP: Tri-Component Attention Profiling for Unsupervised Backdoor Detection in MLLM Fine-Tuning},
  author = {Mingzu Liu and Hao Fang and Runmin Cong},
  journal= {arXiv preprint arXiv:2601.21692},
  year   = {2026}
}

备注

ICML 2026