中文

PEPPER:面向文本到图像扩散模型的感知引导式后门防御

计算与语言 2026-03-19 v3

摘要

最近的研究表明,文本到图像(T2I)扩散模型对后门攻击十分脆弱,其中输入提示中的触发器可以引导生成偏向有害或不必要的内容。除了触发器令牌本身之外,后门效应还会传播到文本嵌入空间中的相邻令牌。为此,我们引入PEPPER(PErcePtion Guided PERturbation),一种后门防御方法,通过将标题改写为语义上远离但视觉上相似的标题,同时添加不可阻挡的元素。通过这种改写策略,PEPPER破坏输入提示中嵌入的触发器,稀释触发器令牌的影响,从而实现增强的鲁棒性。实验表明,PEPPER特别有效地抵御基于文本编码器的攻击,显著降低攻击成功率,同时保持生成质量。除此之外,PEPPER可以与任何现有防御方法结合使用, consistently提供比任何单一方法更强大且更具可泛化性的鲁棒性。我们的代码将在Github上发布。

关键词

引用

@article{arxiv.2511.16830,
  title  = {PEPPER: Perception-Guided Perturbation for Robust Backdoor Defense in Text-to-Image Diffusion Models},
  author = {Oscar Chew and Po-Yi Lu and Jayden Lin and Kuan-Hao Huang and Hsuan-Tien Lin},
  journal= {arXiv preprint arXiv:2511.16830},
  year   = {2026}
}