中文

基于神经元激活变化的文本到图像合成高效输入级后门防御

密码学与安全 2025-08-05 v2

摘要

近年来,文本到图像(T2I)扩散模型因能够生成反映文本提示的高质量图像而受到广泛关注。然而,其日益增长的流行性也导致后门威胁的出现,带来了显著的风险。目前由于后门目标在T2I合成中多样化,缺乏有效的防御策略。本文提出NaviT2I,一个针对多样化T2I后门的高效输入级后门防御框架。我们的 approach 基于一种新观察:触发词汇在扩散生成过程的早期阶段会引发显著的神经元激活变化,我们称之为“早期步骤激活变化”。借助这一洞见,NaviT2I 通过分析由输入词汇引起的神经元激活变化来防止恶意输入。大量实验表明,在多样化数据集、各种T2I后门以及包括UNet和DiT在内的不同模型架构下,NaviT2I 在有效性和效率方面均显著优于基线方法。此外,我们展示了该方法在潜在自适应攻击下仍然有效。

关键词

引用

@article{arxiv.2503.06453,
  title  = {Efficient Input-level Backdoor Defense on Text-to-Image Synthesis via Neuron Activation Variation},
  author = {Shengfang Zhai and Jiajun Li and Yue Liu and Huanran Chen and Zhihua Tian and Wenjie Qu and Qingni Shen and Ruoxi Jia and Yinpeng Dong and Jiaheng Zhang},
  journal= {arXiv preprint arXiv:2503.06453},
  year   = {2025}
}

备注

20 pages. ICCV 2025 (Highlight)