中文

Logic Jailbreak:通过形式逻辑表达式高效解锁 LLM 安全限制

计算与语言 2026-04-27 v4 人工智能

摘要

尽管在与人类价值观对齐方面取得了显著进展,但当前的 LLM 安全机制仍然容易受到越狱攻击。我们假设,这一漏洞源于面向对齐的提示与恶意提示之间的分布性差异。为此,我们引入 LogiBreak,一种新型且通用的黑盒越狱方法,利用逻辑表达式翻译来规避 LLM 安全系统。通过将有害自然语言提示转换为形式逻辑表达式,LogiBreak 利用对齐数据与逻辑输入之间的分布差距,在保持底层语义意图和可读性的同时,规避了安全约束。我们在覆盖三个语言的多语言越狱数据集上评估 LogiBreak,展示了其在各种评估设置和语言环境下的有效性。

关键词

引用

@article{arxiv.2505.13527,
  title  = {Logic Jailbreak: Efficiently Unlocking LLM Safety Restrictions Through Formal Logical Expression},
  author = {Jingyu Peng and Maolin Wang and Nan Wang and Jiatong Li and Yuchen Li and Yuyang Ye and Wanyu Wang and Pengyue Jia and Kai Zhang and Xiangyu Zhao},
  journal= {arXiv preprint arXiv:2505.13527},
  year   = {2026}
}