中文

评估现代大型语言模型中的对抗性漏洞

密码学与安全 2025-11-25 v1 人工智能

摘要

大型语言模型(LLM)的近期快速增长及其在广泛应用场景中的深度集成,要求我们更深入地理解其安全性和鲁棒性。本文present了对两种主流公开可用 LLM(Google 的 Gemini 2.5 Flash 和 OpenAI 的 GPT-4,具体指 GPT-4o mini 模型)针对越狱攻击(jailbreak attacks)易感性的比较分析。研究采用两种主要绕过策略:'自绕过'(self-bypass),即模型被诱导规避自身安全协议;'跨绕过'(cross-bypass),即一个模型生成对抗性提示以利用另一个模型的漏洞。采用四种攻击方法——直接注入、角色扮演、上下文操纵和混淆——生成五类不安全内容:仇恨言论、非法活动、恶意代码、危险内容和误导信息。攻击成功以生成不允许内容为判定依据,成功的越狱攻击将被赋予严重程度评分。研究结果表明,Gemini 2.5 Flash 和 GPT-4 在越狱易感性之间存在差异,表明其安全实现或架构设计存在差异。跨模型攻击尤其有效,表明底层 Transformer 架构中存在大量漏洞。该研究构建了可扩展的自动化 AI 渗透测试框架,提供了对当前 LLM 安全状态的数据驱动性见解,凸显了在模型能力与稳健安全机制之间保持平衡的复杂挑战。

关键词

引用

@article{arxiv.2511.17666,
  title  = {Evaluating Adversarial Vulnerabilities in Modern Large Language Models},
  author = {Tom Perel},
  journal= {arXiv preprint arXiv:2511.17666},
  year   = {2025}
}