将恶意目标隐藏于良性叙事中:通过逻辑链注入越狱大型语言模型
密码学与安全
2024-04-18 v2 人工智能
摘要
对大型语言模型(LLM)的越狱攻击涉及精心设计提示词,以利用模型生成恶意内容。现有的越狱攻击可以成功欺骗LLM,但无法欺骗人类。本文提出一种新型越狱攻击,能够同时欺骗LLM和人类(即安全分析师)。我们的核心思想借鉴自社会心理学——即如果谎言隐藏在真相中,人类很容易被欺骗。基于这一见解,我们提出了逻辑链注入攻击,将恶意意图注入良性事实中。逻辑链注入攻击首先将其恶意目标分解为一系列良性叙述,然后将这些叙述分布到一篇相关的良性文章中,并附上无可置疑的事实。通过这种方式,新生成的提示词不仅能欺骗LLM,还能欺骗人类。
引用
@article{arxiv.2404.04849,
title = {Hidden You Malicious Goal Into Benign Narratives: Jailbreak Large Language Models through Logic Chain Injection},
author = {Zhilong Wang and Yebo Cao and Peng Liu},
journal= {arXiv preprint arXiv:2404.04849},
year = {2024}
}