RAG海盗:针对LLM泄露知识库的自适应攻击
人工智能
2024-12-31 v2
摘要
检索增强生成 (Retrieval-Augmented Generation, RAG) 系统在多个实际服务中的日益普及,引发了严重的安全担忧。RAG系统通过检索机制提升大语言模型 (Large Language Model, LLM) 的生成能力,其背后的私有知识库若意外暴露,可能导致严重后果,包括私人和敏感信息的泄露。本文提出一种黑盒攻击,强制RAG系统泄露其私有知识库。该攻击不同于现有方法,具备自适应和自动化特征。我们采用基于相关性的机制以及攻击方的开源LLM,生成高效查询以泄露隐藏的知识库。大量实验表明,我们提出算法在不同RAG管道和领域中的表现优异,与最新相关方法相比,后者要么未完全黑盒,要么不够自适应,要么不基于开源模型。我们的研究发现,为何在RAG系统的设计和部署中亟需更加稳健的隐私保护措施。
引用
@article{arxiv.2412.18295,
title = {Pirates of the RAG: Adaptively Attacking LLMs to Leak Knowledge Bases},
author = {Christian Di Maio and Cristian Cosci and Marco Maggini and Valentina Poggioni and Stefano Melacci},
journal= {arXiv preprint arXiv:2412.18295},
year = {2024}
}