与 LLM 玩猜谜游戏:基于隐式线索的间接越狱攻击
密码学与安全
2024-08-22 v2 人工智能
人机交互
摘要
随着大型语言模型(LLM)的发展,LLM 的安全威胁日益受到关注。人们提出了大量越狱攻击来评估 LLM 的安全防御能力。当前的越狱攻击主要利用场景伪装技术。然而,它们对恶意意图的明确提及很容易被 LLM 识别和防御。在本文中,我们提出了一种间接越狱攻击方法 Puzzler,它通过隐式地向 LLM 提供一些关于原始恶意查询的线索,从而绕过 LLM 的防御策略并获得恶意响应。此外,受《孙子兵法》中“不能而示之能”智慧的启发,我们采取防御姿态,通过 LLM 收集关于原始恶意查询的线索。大量实验结果表明,Puzzler 在闭源 LLM 上的查询成功率达到 96.6%,比基线方法高出 57.9%–82.7%。此外,在针对最先进的越狱检测方法进行测试时,Puzzler 被证明比基线方法更有效地规避检测。
引用
@article{arxiv.2402.09091,
title = {Play Guessing Game with LLM: Indirect Jailbreak Attack with Implicit Clues},
author = {Zhiyuan Chang and Mingyang Li and Yi Liu and Junjie Wang and Qing Wang and Yang Liu},
journal= {arXiv preprint arXiv:2402.09091},
year = {2024}
}
备注
13 pages, 6 figures