大型语言模型能否自动给 GPT-4V 进行越狱?
计算与语言
2024-08-26 v2
摘要
GPT-4V 因其在整合和处理多模态信息方面的卓越能力而引起广泛关注。同时,其人脸识别能力带来了隐私泄露的新型安全隐患。尽管研究者通过 RLHF 或预处理过滤器努力实现安全对齐,但漏洞可能仍被利用。在本研究中,我们提出 AutoJailbreak——一种受提示优化启发的创新式自动越狱技术。我们利用大型语言模型(LLM)进行红队测试,以优化越狱提示,并采用弱到强的 in-context 学习提示以提升效率。此外,我们提供一种有效的搜索方法,包含早期停止机制,以最小化优化时间和 token 消耗。我们的实验表明,AutoJailbreak 显著超越传统方法,攻击成功率(ASR)超过 95.3%。该研究为加强 GPT-4V 安全性提供了参考,凸显了 LLM 被用于破坏 GPT-4V 完整性的潜在风险。
引用
@article{arxiv.2407.16686,
title = {Can Large Language Models Automatically Jailbreak GPT-4V?},
author = {Yuanwei Wu and Yue Huang and Yixin Liu and Xiang Li and Pan Zhou and Lichao Sun},
journal= {arXiv preprint arXiv:2407.16686},
year = {2024}
}
备注
TrustNLP@NAACL2024 (Fourth Workshop on Trustworthy Natural Language Processing)