Minionese:多语言LLM安全性的综合基准与机制研究
密码学与安全
2026-07-11 v1 人工智能
摘要
大型语言模型中的安全对齐在跨语言中仍然脆弱:在英语中被可靠拒绝的提示在非英语和低资源环境中可能引发有害的顺从。我们引入了\textsc{Minionese},一个多语言越狱基准,涵盖18种语言、4个资源层级和4种扰动类型(标准翻译、语码转换、音译和翻译腔),并配以跨语言层级的拒绝失败的几何机制分析。我们表明,每种攻击类型都会产生独特的脆弱性特征:音译脆弱性由文字系统身份介导,语码转换通过最低资源层级保持有效性,并且层级2和层级3之间的急剧安全机制转变在所有模型中一致。在机制上,低资源越狱通过将有害内容路由通过一个几何上错位的子空间来成功,该子空间在拒绝方向上的投影不足,使拒绝机制保持完整但未被触发。这些发现表明,仅英语的安全评估是不够的;它们需要考虑文字系统家族、扰动类型和每种语言的对齐覆盖率。基准和分析代码位于https://github.com/Brentkong/Minionese-Comprehensive-Benchmark-and-Mechanistic-Study-of-Multilingual-LLM-Safety.git。
引用
@article{arxiv.2607.10112,
title = {Minionese: Comprehensive Benchmark and Mechanistic Study of Multilingual LLM Safety},
author = {Chigozirim Ifebi and Brent Kong and Ayushi Mehrotra},
journal= {arXiv preprint arXiv:2607.10112},
year = {2026}
}