中文

您的提示词安全吗?对开源大型语言模型的提示注入攻击研究

密码学与安全 2025-05-21 v1 计算与语言

摘要

最近的研究表明,大型语言模型 (LLM) 对不同基于提示的攻击具有脆弱性,可能生成有害内容或敏感信息。闭源和开源 LLM 在这些攻击方面的研究不足。本文针对 14 个最流行的开源 LLM 在五个攻击基准测试中进行有效提示注入攻击。当前指标仅考虑成功攻击,而我们提出的攻击成功概率 (ASP) 也捕捉模型响应中的不确定性,反映攻击可行性的模糊性。通过全面分析提示注入攻击的有效性,我们提出一种简单有效的催眠攻击;结果表明,该攻击导致包括 Stablelm2、Mistral、Openchat 和 Vicuna 在内的对齐语言模型生成争议行为,实现约 90% 的 ASP。我们还发现,忽略前缀攻击可突破所有 14 个开源 LLM,在多分类数据集上实现超过 60% 的 ASP。我们发现,中度知名度较高的 LLM 对提示注入攻击更易受攻击,这凸显了提高公众意识和优先制定高效缓解策略的必要性。

关键词

引用

@article{arxiv.2505.14368,
  title  = {Is Your Prompt Safe? Investigating Prompt Injection Attacks Against Open-Source LLMs},
  author = {Jiawen Wang and Pritha Gupta and Ivan Habernal and Eyke Hüllermeier},
  journal= {arXiv preprint arXiv:2505.14368},
  year   = {2025}
}

备注

8 pages, 3 figures, EMNLP 2025 under review