当一种模态主宰一切:多模态扩散模型中的后门模态坍缩
机器学习
2026-03-09 v1
摘要
虽然扩散模型已经彻底改变了视觉内容生成,但其快速普及凸显了研究其脆弱性(例如,对后门攻击)的迫切需要。在多模态扩散模型中,人们自然期望同时攻击多种模态(例如,文本和图像)会产生互补效应并增强整体后门效果。在本文中,我们通过研究后门模态坍缩现象来挑战这一假设,这是一种后门机制退化到主要依赖模态子集,使其他模态变得多余的情景。为了严格量化这种行为,我们引入了两个新的度量标准:触发模态归因和跨触发交互。通过在多样化的训练配置下对多模态条件扩散进行广泛实验,我们一致观察到后门行为中的“赢家通吃”动态。我们的结果表明:(1) 攻击常常坍缩为子集模态主导,并且 (2) 跨模态交互可以忽略不计甚至是负面的,这与协同脆弱性的直觉相矛盾。这些发现揭示了当前评估中的一个关键盲点,表明高攻击成功率往往掩盖了对模态子集的基本依赖。这为机制分析和未来的防御开发建立了原则性基础。
引用
@article{arxiv.2603.06508,
title = {When One Modality Rules Them All: Backdoor Modality Collapse in Multimodal Diffusion Models},
author = {Qitong Wang and Haoran Dai and Haotian Zhang and Christopher Rasmussen and Binghui Wang},
journal= {arXiv preprint arXiv:2603.06508},
year = {2026}
}
备注
Accepted to the ICLR 2026 Workshop on Principled Design for Trustworthy AI. The first two authors contributed equally