中文

通过交叉注意力比例缩放暴露触发器:基于交叉注意力比例缩放响应发散的文本到图像扩散模型输入级后门检测

密码学与安全 2026-04-15 v1 计算机视觉与模式识别

摘要

文本到图像扩散模型取得了显著的合成成功,但其依赖大规模数据和开放生态系统带来了严重的后门安全风险。现有防御,特别是输入级方法,虽然更适用于部署,但往往依赖可观察的异常特征,在难以察觉且保持语义的触发器设计下变得不可靠。随着现代后门攻击日益将触发器嵌入自然输入,这些方法的性能显著下降,这引出一个关键问题:能否利用更稳定、隐式且对触发器不敏感的 benign 与后门输入之间的差异用于检测?本文从主动探针角度切入。我们引入对交叉注意力的受控比例缩放扰动,发现一种称为交叉注意力比例缩放响应发散(CSRD)的新现象,即 benign 与后门输入在去噪步骤中表现出系统性不同的响应演化模式。基于这一洞察,我们提出SET框架,在多尺度扰动下构建响应偏移特征,并从小组干净样本中学习紧凑的 benign 响应空间。随后通过测量与该学习空间的偏差进行检测,无需先验知识即可实现对攻击或模型训练的访问。广泛实验表明,SET 在多样化攻击方法、触发器类型和模型设置下均显著优于现有基线,在难以察觉的隐式触发器场景下提升尤为显著。总体而言,SET 在 AUROC 上提升最高可达9.1%,在 ACC 上提升最高可达6.5%,凸显其在实际部署中的有效性和鲁棒性。

关键词

引用

@article{arxiv.2604.12446,
  title  = {Scaling Exposes the Trigger: Input-Level Backdoor Detection in Text-to-Image Diffusion Models via Cross-Attention Scaling},
  author = {Zida Li and Jun Li and Yuzhe Sha and Ziqiang Li and Lizhi Xiong and Zhangjie Fu},
  journal= {arXiv preprint arXiv:2604.12446},
  year   = {2026}
}

备注

Under Review