中文

利用低资源语言对 LLM 的多语言越狱攻击

计算与语言 2026-05-19 v1 人工智能

摘要

大型语言模型(LLM)仍然容易受到规避安全护栏的越狱攻击。我们调查了使用低资源非洲语言(Afrikaans、Kiswahili、isiXhosa 和 isiZulu)的多轮对话能否绕过商业 LLM 的安全机制。我们翻译了现有数据集中的提示,并通过自动化测试及与母语者的人工红队测试,对 ChatGPT、Claude、DeepSeek、Gemini 和 Grok 进行了评估。单轮翻译攻击被证明无效,而多轮对话实现了从 52.7%(Claude 3.5 Haiku)到 83.6%(GPT-4o-mini)的英文有害响应率,从 60.0%(Claude 3.5 Haiku)到 78.2%(GPT-4o-mini)的 Afrikaans 有害响应率,以及从 41.8%(Claude 3.5 Haiku)到 70.9%(DeepSeek)的 Kiswahili 有害响应率。与自动化方法相比,人工红队测试提高了越狱率。在所有评估语言中,平均越狱率从 59.8% 增至 75.8%,其中 Afrikaans 提升 +20.0%、isiZulu 提升 +12.7%、isiXhosa 提升 +12.3%、Kiswahili 提升 +1%,这表明糟糕的翻译质量限制了越狱成功率。这些发现表明,LLM 中的漏洞在多语言语境中持续存在,且翻译质量是决定低资源语言越狱成功与否的关键因素。

关键词

引用

@article{arxiv.2605.18239,
  title  = {Multilingual jailbreaking of LLMs using low-resource languages},
  author = {Dylan Marx and Marcel Dunaiski},
  journal= {arXiv preprint arXiv:2605.18239},
  year   = {2026}
}

备注

12 pages, 5 figures