中文

大语言模型是非自愿的真理者:利用谬误失效进行越狱攻击

计算与语言 2025-05-26 v3 人工智能

摘要

我们发现语言模型在生成谬误和欺骗性推理方面存在困难。当被要求生成欺骗性输出时,语言模型倾向于泄露诚实的版本但认为其为假。利用这一缺陷,我们提出一种越狱攻击方法,引导对齐后的语言模型生成恶意输出。具体而言,我们查询模型以生成一种谬误却真实的危害行为程序。由于谬误程序通常被视为虚假从而被视为无害,因而有助于绕过安全机制。然而,该输出在事实上具有危害性,因为语言模型无法制造谬误的解决方案,却提出了诚实的方案。我们对该方法进行了评估,测试了五个安全对齐的大型语言模型,比较了四种先前的越狱方法,结果显示该方法在产生更有害输出方面表现出竞争力。我们认为,这一发现可超越模型安全领域,例如自我验证和幻觉检测。

关键词

引用

@article{arxiv.2407.00869,
  title  = {Large Language Models Are Involuntary Truth-Tellers: Exploiting Fallacy Failure for Jailbreak Attacks},
  author = {Yue Zhou and Henry Peng Zou and Barbara Di Eugenio and Yang Zhang},
  journal= {arXiv preprint arXiv:2407.00869},
  year   = {2025}
}

备注

Accepted to the main conference of EMNLP 2024