LLM能否深度检测复杂恶意查询?一种通过意图混淆实现越狱的框架
密码学与安全
2024-05-08 v2 人工智能
摘要
为了展示和解决潜在的恶意性,我们提出了一种理论假设和分析方法,并引入了一种新的黑盒越狱攻击方法,命名为IntentObfuscator,通过混淆用户提示背后的真实意图来利用这一已识别的缺陷。这种方法迫使LLM无意中生成受限内容,绕过其内置的内容安全措施。我们详细介绍了该框架下的两种实现:“模糊意图”和“制造歧义”,它们通过操纵查询的复杂性和歧义性来有效规避恶意意图检测。我们通过实验验证了IntentObfuscator方法在多个模型上的有效性,包括ChatGPT-3.5、ChatGPT-4、Qwen和Baichuan,平均越狱成功率达到69.21%。值得注意的是,在声称拥有1亿周活跃用户的ChatGPT-3.5上,我们的测试取得了83.65%的显著成功率。我们还将验证扩展到各种类型的敏感内容,如暴力图片、种族主义、性别歧视、政治敏感性、网络安全威胁和犯罪技巧,进一步证明了我们的发现对增强针对LLM内容安全框架的“红队”策略的重大影响。
引用
@article{arxiv.2405.03654,
title = {Can LLMs Deeply Detect Complex Malicious Queries? A Framework for Jailbreaking via Obfuscating Intent},
author = {Shang Shang and Xinqiang Zhao and Zhongjiang Yao and Yepeng Yao and Liya Su and Zijing Fan and Xiaodan Zhang and Zhengwei Jiang},
journal= {arXiv preprint arXiv:2405.03654},
year = {2024}
}