WordGame: 通过查询与响应同时混淆实现高效且有效的LLM越狱
机器学习
2024-05-24 v1
摘要
最近大型语言模型(LLM)如ChatGPT的突破以前所未有的速度革新了生产流程。与此同时,人们越来越担心LLM容易受到越狱攻击,导致生成有害或不安全的内容。尽管LLM中实施了安全对齐措施以缓解现有的越狱尝试并迫使它们变得越来越复杂,但这仍然远非完美。在本文中,我们分析了当前安全对齐的常见模式,并表明可以通过在查询和响应中同时进行混淆来利用这些模式进行越狱攻击。具体来说,我们提出了WordGame攻击,它将恶意词汇替换为文字游戏,以分解查询的对抗意图,并鼓励在响应中先于预期的有害内容出现关于游戏的良性内容,从而创建一个几乎不被任何用于安全对齐的语料库覆盖的上下文。大量实验表明,WordGame攻击可以突破当前领先的专有和开源LLM(包括最新的Claude-3、GPT-4和Llama-3模型)的防护栏。进一步对查询和响应中这种同时混淆的消融研究提供了该攻击策略超越单个攻击的优势证据。
引用
@article{arxiv.2405.14023,
title = {WordGame: Efficient & Effective LLM Jailbreak via Simultaneous Obfuscation in Query and Response},
author = {Tianrong Zhang and Bochuan Cao and Yuanpu Cao and Lu Lin and Prasenjit Mitra and Jinghui Chen},
journal= {arXiv preprint arXiv:2405.14023},
year = {2024}
}