中文

猜猜我是谁!面向检索增强生成的隐蔽成员推理攻击

密码学与安全 2025-07-01 v2 人工智能 计算与语言 信息检索 机器学习

摘要

检索增强生成(RAG)使大型语言模型(LLM)能够在不改变模型参数的情况下,利用外部知识库生成有依据的响应。虽然免于权重调整可防止通过模型参数泄露信息,但这引入了推理攻击者利用模型上下文中所检索文档的风险。现有的成员推理和数据提取方法通常依赖越狱或精心构造的非自然查询,这些查询很容易被RAG系统中常见的查询重写技术检测或阻止。在这项工作中,我们提出了审讯攻击(IA),这是一种针对RAG数据存储中文档的成员推理技术。通过构造只有目标文档存在时才能回答的自然文本查询,我们的方法仅用30个查询就成功实现了推理,同时保持隐蔽性;直接检测器识别现有方法生成的对抗性提示的频率,比识别我们攻击生成的提示高出约76倍。我们观察到,在多种RAG配置下,我们的攻击在1%误报率下的真阳性率比先前的推理攻击提高了2倍,而每次文档推理的成本不到0.02美元。

关键词

引用

@article{arxiv.2502.00306,
  title  = {Riddle Me This! Stealthy Membership Inference for Retrieval-Augmented Generation},
  author = {Ali Naseh and Yuefeng Peng and Anshuman Suri and Harsh Chaudhari and Alina Oprea and Amir Houmansadr},
  journal= {arXiv preprint arXiv:2502.00306},
  year   = {2025}
}

备注

This is the full version (27 pages) of the paper 'Riddle Me This! Stealthy Membership Inference for Retrieval-Augmented Generation' published at CCS 2025