Antelope:强大且隐蔽的越狱攻击策略
密码学与安全
2024-12-12 v1 人工智能
计算机视觉与模式识别
摘要
由于扩散模型卓越的生成潜力,大量研究探讨了针对这些框架的越狱攻击。一个尤其值得关注的威胁在于图像模型中生成不适宜工作内容(NSFW)。尽管已实施安全过滤器,仍有大量研究持续探索绕过这些防护措施的方法。现有的攻击方法主要涵盖对抗提示工程或概念混淆,但它们通常存在搜索效率低、攻击特征明显以及与目标对齐度差等问题。为克服这些挑战,我们提出了 Antelope,一种更鲁棒且隐蔽的越狱攻击策略,旨在暴露生成模型固有的安全漏洞。具体而言,Antelope 利用敏感概念与相似概念之间的混淆,在这些相关概念的语义相邻空间中进行搜索,并与目标图像对齐,从而生成与目标一致且能规避检测敏感图像。此外,我们成功利用了基于模型攻击的迁移性来渗透在线黑盒服务。实验评估表明,Antelope 在多种防御机制下优于现有基线,凸显了其有效性和 versatility。
引用
@article{arxiv.2412.08156,
title = {Antelope: Potent and Concealed Jailbreak Attack Strategy},
author = {Xin Zhao and Xiaojun Chen and Haoyu Gao},
journal= {arXiv preprint arXiv:2412.08156},
year = {2024}
}