中文

多编码器扩散模型的轻量级后门攻击

机器学习 2026-03-05 v1 计算机视觉与模式识别

摘要

随着文本到图像扩散模型在实际应用中的部署增多,后门攻击的关注度日益增加。先前针对文本基型后门攻击的工作主要集中在单一轻量级文本编码器条件下的扩散模型上。然而,近期采用多个大规模文本编码器的扩散模型在此背景下仍未得到充分探讨。鉴于多个文本编码器引入的可训练参数显著增加,一个重要问题是:在此类设置下,后门攻击是否能够保持高效且有效?本文研究了Stable Diffusion 3,该模型使用三个独立文本编码器且尚未系统性地进行文本编码器基型后门漏洞分析。为理解文本编码器在后门攻击中的作用,我们定义了四类攻击目标,确定实现每种攻击目标有效性能所需的最小编码器集合。基于此,我们进一步提出了多编码器轻量级攻击 (Multi-Encoder Lightweight aTtacks, MELT),该方法仅训练低秩适配器而保持预训练文本编码器权重冻结。我们展示,在微调总编码器参数不到0.2%的情况下,即可成功对Stable Diffusion 3实施后门攻击,揭示了多编码器设置下实际攻击场景中previously underexplored的漏洞。

关键词

引用

@article{arxiv.2603.04064,
  title  = {Tuning Just Enough: Lightweight Backdoor Attacks on Multi-Encoder Diffusion Models},
  author = {Ziyuan Chen and Yujin Jeong and Tobias Braun and Anna Rohrbach},
  journal= {arXiv preprint arXiv:2603.04064},
  year   = {2026}
}