大语言模型是非自愿的真理者:利用谬误失效进行越狱攻击
计算与语言
2025-05-26 v3 人工智能
摘要
我们发现语言模型在生成谬误和欺骗性推理方面存在困难。当被要求生成欺骗性输出时,语言模型倾向于泄露诚实的版本但认为其为假。利用这一缺陷,我们提出一种越狱攻击方法,引导对齐后的语言模型生成恶意输出。具体而言,我们查询模型以生成一种谬误却真实的危害行为程序。由于谬误程序通常被视为虚假从而被视为无害,因而有助于绕过安全机制。然而,该输出在事实上具有危害性,因为语言模型无法制造谬误的解决方案,却提出了诚实的方案。我们对该方法进行了评估,测试了五个安全对齐的大型语言模型,比较了四种先前的越狱方法,结果显示该方法在产生更有害输出方面表现出竞争力。我们认为,这一发现可超越模型安全领域,例如自我验证和幻觉检测。
引用
@article{arxiv.2407.00869,
title = {Large Language Models Are Involuntary Truth-Tellers: Exploiting Fallacy Failure for Jailbreak Attacks},
author = {Yue Zhou and Henry Peng Zou and Barbara Di Eugenio and Yang Zhang},
journal= {arXiv preprint arXiv:2407.00869},
year = {2025}
}
备注
Accepted to the main conference of EMNLP 2024