中文

基于 RAG 的 LLM 的混淆中臂风险

密码学与安全 2024-10-24 v5 人工智能

摘要

检索增强生成(RAG)是一种大型语言模型(LLM)从数据库中检索有用信息后再生成响应的过程。这类系统正在广泛应用于企业日常业务运营中。例如,面向 Microsoft 365 的 Copilot 已累积了数百万家企业。然而,采用此类 RAG-based 系统的安全影响尚不明确。本文引入 ConfusedPilot,阐述了 RAG 系统的一种类安全漏洞,这些漏洞会使 Copilot 产生误导,从而在其响应中导致完整性和机密性违规。首先,我们调查了一个将恶意文本嵌入 RAG 中修改提示的漏洞,破坏 LLM 生成的响应。其次,我们演示了一个利用检索期间缓存机制泄露秘密数据的漏洞。我们还调查了这两种漏洞如何被利用以在企业内部传播误information,最终影响其运营,如销售和制造。我们还讨论了通过调查 RAG-based 系统的体系结构来揭示这些攻击的根本原因。本研究凸显了今天 RAG-based 系统中的安全漏洞,并为 securing 未来的 RAG-based 系统提出了设计指南。

关键词

引用

@article{arxiv.2408.04870,
  title  = {ConfusedPilot: Confused Deputy Risks in RAG-based LLMs},
  author = {Ayush RoyChowdhury and Mulong Luo and Prateek Sahu and Sarbartha Banerjee and Mohit Tiwari},
  journal= {arXiv preprint arXiv:2408.04870},
  year   = {2024}
}