中文

CAHS-Attack:基于CLIP的启发式搜索攻击方法用于Stable Diffusion

密码学与安全 2025-11-27 v1 人工智能

摘要

扩散模型在面对对抗性提示时表现出显著脆弱性,加强攻击能力对于揭示此类漏洞并构建更健壮的生成系统至关重要。现有工作常依赖对模型梯度的白盒访问或手工设计提示工程,而在实际部署中由于访问受限或攻击效果不佳,这种做法不可行。本文提出CAHS-Attack,一种CLIP感知启发式搜索攻击方法。CAHS-Attack将蒙特卡洛树搜索(MCTS)集成以进行细粒度后缀优化,利用受限遗传算法预筛选高潜力对抗性提示作为根节点,并在每个仿真滚动中保留最具语义破坏性的结果,以实现高效的局部搜索。大量实验表明,该方法在不同语义的短提示和长提示上均实现了跨模态的SOTA攻击性能。 Furthermore,我们发现SD模型的脆弱性可归因于其CLIP基文本编码器的内在漏洞,这表明当前文本到图像管道存在根本性安全风险。

关键词

引用

@article{arxiv.2511.21180,
  title  = {CAHS-Attack: CLIP-Aware Heuristic Search Attack Method for Stable Diffusion},
  author = {Shuhan Xia and Jing Dai and Hui Ouyang and Yadong Shang and Dongxiao Zhao and Peipei Li},
  journal= {arXiv preprint arXiv:2511.21180},
  year   = {2025}
}