分析大语言模型(LLMs)的固有响应倾向:真实世界指令驱动的越狱
计算与语言
2024-02-26 v2
摘要
大量工作致力于改进大语言模型(LLMs)的安全机制。然而,面对恶意指令时,LLMs 仍倾向于生成有害响应,这一现象被称为“越狱攻击”。在我们的研究中,我们引入了一种新颖的自动越狱方法 RADIAL,其通过放大 LLMs 生成肯定响应的潜力来绕过安全机制。我们方法的越狱思想是“固有响应倾向分析”,即识别本质上能诱导 LLMs 生成肯定响应的真实世界指令,相应的越狱策略是“真实世界指令驱动的越狱”,涉及将通过上述分析识别的真实世界指令策略性地拼接在恶意指令周围。我们的方法在五个开源先进 LLMs 的英文恶意指令上实现了优异的攻击性能,同时在针对中文恶意指令的跨语言攻击中保持鲁棒的攻击性能。我们进行实验验证了越狱思想的合理性和越狱策略设计的合理性。值得注意的是,我们的方法设计了语义连贯的攻击提示,突出了 LLMs 的潜在风险。我们的研究提供了关于越狱攻击的详细见解,为开发更安全的 LLMs 奠定了基础。
引用
@article{arxiv.2312.04127,
title = {Analyzing the Inherent Response Tendency of LLMs: Real-World Instructions-Driven Jailbreak},
author = {Yanrui Du and Sendong Zhao and Ming Ma and Yuhan Chen and Bing Qin},
journal= {arXiv preprint arXiv:2312.04127},
year = {2024}
}