Pandora:通过检索增强生成投毒实现 GPT 越狱
密码学与安全
2024-02-14 v1
摘要
大型语言模型 (LLMs) 已获得极高普及度,并正日益应用于各个领域。因此,确保这些模型的安全性至关重要。越狱攻击通过操纵 LLMs 生成恶意内容,被视为一种重大漏洞。虽然现有研究主要集中在针对 LLMs 的直接越狱攻击上,但对间接方法的探索仍然有限。各种插件(尤其是检索增强生成 (RAG))与 LLMs 的集成,使得 LLMs 能够将外部知识库纳入其响应生成过程(例如 GPTs),这为间接越狱攻击引入了新途径。为填补这一空白,我们研究了针对 LLMs(特别是 GPTs)的间接越狱攻击,提出了一种名为“检索增强生成投毒”的新型攻击向量。该方法(Pandora)利用 LLMs 与 RAG 之间的协同效应,通过提示词操纵生成意外响应。Pandora 使用恶意 crafted 内容影响 RAG 过程,从而有效发起越狱攻击。我们的初步测试表明,Pandora 在四种不同场景中成功实施了越狱攻击,其成功率高于直接攻击,其中 GPT-3.5 为 64.3%,GPT-4 为 34.8%。
引用
@article{arxiv.2402.08416,
title = {Pandora: Jailbreak GPTs by Retrieval Augmented Generation Poisoning},
author = {Gelei Deng and Yi Liu and Kailong Wang and Yuekang Li and Tianwei Zhang and Yang Liu},
journal= {arXiv preprint arXiv:2402.08416},
year = {2024}
}
备注
6 pages