中文

反事实可解释递增提示攻击分析:面对大语言模型

密码学与安全 2024-07-18 v2

摘要

本研究通过对提示攻击的可解释分析,识别并缓解大型语言模型(如 GPT-4 和 LLaMA-2)的漏洞,凸显加强安全措施和隐私保护的必要性。我们提出了反事实可解释递增提示攻击(Counterfactual Explainable Incremental Prompt Attack, CEIPA)技术,通过特定方式引导提示,从而定量衡量攻击效果并探索这些模型中内嵌的防御机制。我们的 метод的独特之处在于通过递增的反事实方法阐明大型语言模型生成有害响应的原因。我们将提示修改过程组织为四个递增层次:单词、句子、字符以及单词和字符的组合,从而全面检验大型语言模型固有的脆弱性。研究发现不仅提供了反事实解释见解,而且表明我们的框架显著增强了攻击提示的效果。

关键词

引用

@article{arxiv.2407.09292,
  title  = {Counterfactual Explainable Incremental Prompt Attack Analysis on Large Language Models},
  author = {Dong Shu and Mingyu Jin and Tianle Chen and Chong Zhang and Yongfeng Zhang},
  journal= {arXiv preprint arXiv:2407.09292},
  year   = {2024}
}

备注

23 pages, 6 figures