ArtPrompt:基于 ASCII 艺术的对齐 LLM 的攻击性越狱
计算与语言
2024-06-10 v4 人工智能
摘要
大型语言模型 (LLM) 的使用必须关注其安全性。已developed多种技术,如数据过滤和监督式微调,以加强 LLM 的安全性。然而,当前已知的技术假设用于 LLM 安全对齐的语料库仅由语义解释。但这一假设在实际应用中不成立,导致 LLM 面临严重漏洞。例如,论坛用户经常使用 ASCII 艺术,这是一种基于文本的艺术形式,用于传递图像信息。本文提出了一种新型的基于 ASCII 艺术的越狱攻击,并引入了全面的基准 Vision-in-Text Challenge (ViTC),用于评估 LLM 在识别无法仅由语义解释的提示方面的能力。我们展示了五种最先进 LLM (GPT-3.5、GPT-4、Gemini、Claude 和 Llama2) 在识别以 ASCII 艺术形式提供的提示方面的困难。基于此观察,我们开发了一种越狱攻击 ArtPrompt,该攻击利用 LLM 识别 ASCII 艺术性能差的弱点,以规避安全措施并诱发 LLM 的不期望行为。ArtPrompt 仅需对目标 LLM 进行黑盒访问,因而具有实际操作性。我们对 ArtPrompt 在五种最先进 LLM 上的评估表明,ArtPrompt 能够有效且高效地诱发所有五种 LLM 的不期望行为。我们的代码已公开于 https://github.com/uw-nsl/ArtPrompt。
引用
@article{arxiv.2402.11753,
title = {ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs},
author = {Fengqing Jiang and Zhangchen Xu and Luyao Niu and Zhen Xiang and Bhaskar Ramasubramanian and Bo Li and Radha Poovendran},
journal= {arXiv preprint arXiv:2402.11753},
year = {2024}
}
备注
To appear in ACL 2024