隐形面具:大型语言模型中伪装性越狱的基准测试
密码学与安全
2025-09-09 v1 人工智能
摘要
大型语言模型(LLMs)日益暴露于一种被称为伪装性越狱的对抗性提示攻击。该方法将恶意意图嵌入看似善意的语言,以规避现有安全机制。与公开攻击不同,这些微妙的提示利用语言的上下文模糊性和灵活性,构成了当前防御系统的重大挑战。本文调查了伪装性越狱提示的构建与影响,强调其欺骗性特征以及传统关键词基于检测方法的局限性。我们引入了一个新型基准数据集,包含 500 个精选示例(400 个有害提示和 100 个善意提示),旨�严格检验 LLM 安全协议。此外,我们提出了一个多维度评估框架,衡量七个维度:安全意识、技术可行性、实施保护、有害潜力、教育价值、内容质量和合规得分。我们的发现揭示了 LLM 行为的鲜明对比:尽管模型在善意输入下表现出高水平的安全性和内容质量,但在面对伪装性越狱尝试时,表现显著下降。这种差异凸显了一种普遍性漏洞,突显了为确保 LLM 在实际应用中负责任且稳健部署的迫切需要。
引用
@article{arxiv.2509.05471,
title = {Behind the Mask: Benchmarking Camouflaged Jailbreaks in Large Language Models},
author = {Youjia Zheng and Mohammad Zandsalimy and Shanu Sushmita},
journal= {arXiv preprint arXiv:2509.05471},
year = {2025}
}