中文

释放蠕虫与提取数据:利用越狱攻击扩大针对 RAG 推理攻击的规模与严重性

密码学与安全 2025-01-31 v1 人工智能

摘要

本文表明,凭借对 GenAI 模型进行越狱攻击的能力,攻击者可以扩大针对基于 RAG 的 GenAI 应用攻击结果的严重性与规模。在论文第一部分,我们表明攻击者可以将 RAG 成员推理攻击和 RAG 实体提取攻击升级为 RAG 文档提取攻击,从而造成比现有攻击更严重的后果。我们评估了三种提取方法获得的结果、所采用的五种嵌入算法的类型与大小的影响、所提供上下文的大小以及 GenAI 引擎的影响。我们表明,攻击者可以提取问答聊天机器人 RAG 所用数据库中 80%-99.8% 的数据。在论文第二部分,我们表明攻击者可以将 RAG 数据投毒攻击的规模从攻陷单个 GenAI 应用扩大到攻陷整个 GenAI 生态系统,从而造成更大规模的破坏。这是通过构造对抗性自复制提示词来实现的,该提示词在生态系统内触发计算机蠕虫的连锁反应,并迫使每个受感染的应用执行恶意活动,进而攻陷其他应用的 RAG。我们评估了该蠕虫在由 GenAI 驱动的电子邮件助手组成的 GenAI 生态系统中创建用户机密数据提取链的性能,并分析了该蠕虫的性能如何受上下文大小、所使用的对抗性自复制提示词、所采用的嵌入算法的类型与大小以及传播中的跳数的影响。最后,我们回顾并分析了用于保护基于 RAG 推理的防护机制,并讨论了其权衡关系。

关键词

引用

@article{arxiv.2409.08045,
  title  = {Unleashing Worms and Extracting Data: Escalating the Outcome of Attacks against RAG-based Inference in Scale and Severity Using Jailbreaking},
  author = {Stav Cohen and Ron Bitton and Ben Nassi},
  journal= {arXiv preprint arXiv:2409.08045},
  year   = {2025}
}

备注

for Github, see https://github.com/StavC/UnleashingWorms-ExtractingData . arXiv admin note: substantial text overlap with arXiv:2403.02817