中文

Antelope:强大且隐蔽的越狱攻击策略

密码学与安全 2024-12-12 v1 人工智能 计算机视觉与模式识别

摘要

由于扩散模型卓越的生成潜力,大量研究探讨了针对这些框架的越狱攻击。一个尤其值得关注的威胁在于图像模型中生成不适宜工作内容(NSFW)。尽管已实施安全过滤器,仍有大量研究持续探索绕过这些防护措施的方法。现有的攻击方法主要涵盖对抗提示工程或概念混淆,但它们通常存在搜索效率低、攻击特征明显以及与目标对齐度差等问题。为克服这些挑战,我们提出了 Antelope,一种更鲁棒且隐蔽的越狱攻击策略,旨在暴露生成模型固有的安全漏洞。具体而言,Antelope 利用敏感概念与相似概念之间的混淆,在这些相关概念的语义相邻空间中进行搜索,并与目标图像对齐,从而生成与目标一致且能规避检测敏感图像。此外,我们成功利用了基于模型攻击的迁移性来渗透在线黑盒服务。实验评估表明,Antelope 在多种防御机制下优于现有基线,凸显了其有效性和 versatility。

关键词

引用

@article{arxiv.2412.08156,
  title  = {Antelope: Potent and Concealed Jailbreak Attack Strategy},
  author = {Xin Zhao and Xiaojun Chen and Haoyu Gao},
  journal= {arXiv preprint arXiv:2412.08156},
  year   = {2024}
}