中文

巴别塔再临:闭源大语言模型上的多语言越狱提示

计算与语言 2025-05-20 v1 人工智能

摘要

大语言模型(LLM)已在各类领域广泛应用,但仍面临对抗性提示注入的脆弱性。虽然现有关于越狱攻击和幻觉现象的研究主要聚焦开源模型,但本文聚焦闭源 LLM 在多语言攻击情境下的前沿表现。我们提出首个集成性对抗框架,利用多样化攻击技术系统评估主流专有解决方案,包括 GPT-4o、DeepSeek-R1、Gemini-1.5-Pro 和 Qwen-Max。我们的评估涵盖六类安全内容的英文和中文,生成 38,400 条响应,涉及 32 种越狱攻击类型。以攻击成功率(ASR)作为量化指标,从提示设计、模型架构和语言环境三个维度评估性能。我们的发现表明 Qwen-Max 最易受攻击,而 GPT-4o 抗性最强。值得注意的是,中文提示的 ASR 一致高于英文提示,而我们新提出的 Two-Sides 攻击技术在所有模型中均最为有效。本工作凸显 LLM 语言感知对齐和跨语言防御的迫切需求,期望激励研究者、开发者和政策制定者致力于构建更稳健且包容性的 AI 系统。

关键词

引用

@article{arxiv.2505.12287,
  title  = {The Tower of Babel Revisited: Multilingual Jailbreak Prompts on Closed-Source Large Language Models},
  author = {Linghan Huang and Haolin Jin and Zhaoge Bi and Pengyue Yang and Peizhou Zhao and Taozhao Chen and Xiongfei Wu and Lei Ma and Huaming Chen},
  journal= {arXiv preprint arXiv:2505.12287},
  year   = {2025}
}