中文

Chain of Attack:一种语义驱动的 LLM 上下文多轮攻击器

计算与语言 2024-05-10 v1 密码学与安全 机器学习

摘要

大型语言模型(LLM)在各种自然语言处理任务中取得了显著性能,尤其是在对话系统中。然而,LLM 也可能带来安全和道德威胁,特别是在多轮对话中,大型模型更容易受到上下文内容的引导,从而产生有害或带有偏见的回复。在本文中,我们提出了一种在多轮对话中攻击 LLM 的新方法,称为 CoA(Chain of Attack)。CoA 是一种语义驱动的上下文多轮攻击方法,它在与大型模型的多轮对话中,通过上下文反馈和语义相关性自适应地调整攻击策略,导致模型产生不合理或有害的内容。我们在不同的 LLM 和数据集上评估了 CoA,结果表明它能有效暴露 LLM 的漏洞,并优于现有的攻击方法。我们的工作为攻击和防御 LLM 提供了新的视角和工具,并有助于对话系统的安全与伦理评估。

关键词

引用

@article{arxiv.2405.05610,
  title  = {Chain of Attack: a Semantic-Driven Contextual Multi-Turn attacker for LLM},
  author = {Xikang Yang and Xuehai Tang and Songlin Hu and Jizhong Han},
  journal= {arXiv preprint arXiv:2405.05610},
  year   = {2024}
}