中文

利用符号数学进行大语言模型的越狱

密码学与安全 2024-11-06 v2 人工智能 计算与语言 机器学习

摘要

近期的人工智能安全进展促使人们加大训练和红队测试大型语言模型(LLM)的力度,以缓解不安全内容生成的问题。然而,这些安全机制可能并不完善,留下了潜在的漏洞。本文引入了 MathPrompt,一种新颖的越狱技术,利用大语言模型在符号数学方面的先进能力,以规避其安全机制。通过将有害的自然语言提示编码为数学问题,我们展示了当前人工智能安全措施的一个关键漏洞。我们在 13 种最先进的大语言模型上进行实验,发现平均攻击成功率为 73.6\%,这表明现有的安全训练机制无法泛化到数学编码输入。分析嵌入向量显示,原始提示与编码提示之间的语义发生了实质性的偏移,这有助于解释攻击的成功。该工作强调了全面方法在人工智能安全方面的重要性,呼吁扩展红队测试工作,以在所有潜在输入类型及其相关风险上开发出鲁健的安全措施。

关键词

引用

@article{arxiv.2409.11445,
  title  = {Jailbreaking Large Language Models with Symbolic Mathematics},
  author = {Emet Bethany and Mazal Bethany and Juan Arturo Nolazco Flores and Sumit Kumar Jha and Peyman Najafirad},
  journal= {arXiv preprint arXiv:2409.11445},
  year   = {2024}
}