中文

对话注入攻击:通过上下文操控劫持LLM

计算与语言 2025-03-12 v1

摘要

大型语言模型(LLM)在 various applications中显示出显著的实用性,但其部署受到安全漏洞的困扰,尤其是劫持攻击。这些攻击通过精心设计的对抗性提示来操控LLM生成有害或不道德的内容。虽然当前关于劫持攻击的研究主要聚焦于单轮交互,但 largely忽略了历史对话对模型行为的影响。本文引入一种新型劫持范式,对话注入攻击(DIA),该攻击利用对话历史来提高此类攻击的成功率。DIA operates in a black-box setting,only requires access to the chat API或了解LLM的聊天模板。我们提出了两种构建对抗历史对话的方法:一种适配灰盒预填充攻击,另一种利用延迟响应。我们的实验表明,DIA在最新的LLM(包括Llama-3.1和GPT-4o)上实现了 state-of-the-art 的攻击成功率。此外,我们展示了DIA可以绕过5种不同的防御机制,凸显了其鲁健性和有效性。

关键词

引用

@article{arxiv.2503.08195,
  title  = {Dialogue Injection Attack: Jailbreaking LLMs through Context Manipulation},
  author = {Wenlong Meng and Fan Zhang and Wendao Yao and Zhenyuan Guo and Yuwei Li and Chengkun Wei and Wenzhi Chen},
  journal= {arXiv preprint arXiv:2503.08195},
  year   = {2025}
}

备注

17 pages, 10 figures