E-MIA:针对 RAG 系统的考试式黑盒成员推断攻击
密码学与安全
2026-05-05 v1 人工智能
摘要
检索增强生成 (RAG) 通过在推理时检索文档为大型语言模型 (LLM) 提供外部证据,但这也使检索语料库成为敏感资产。在黑盒设置下,攻击者仅通过查询响应交互即可推断给定候选文档是否已被 ingested 进入 RAG 知识库(即文档级成员推断),从而泄露语料库覆盖范围和敏感主题的存在。现有 RAG 成员推断方法要么依赖语义相似性等软信号,导致成员/非成员得分分布重叠且阈值不稳定,要么采用显式确认探针,意图明显易被拒绝和检测。我们提出 E-MIA,将目标文档中可验证的硬证据(如细粒度细节、专有名词/技术术语、定义性陈述、元数据线索以及因果/约束关系)转化为四种可客观评分的题目类型 (FB/SC/MC/T/F),并以多个证据针对性问题的累计考试得分为成员信号。跨多个数据集和多样化 RAG 配置的实验表明,E-MIA 在严格设置下提高了成员/非成员可分性,同时保持自然、隐蔽的查询;我们进一步分析了问题组成和考试长度对攻击效果的影响。
引用
@article{arxiv.2605.00955,
title = {E-MIA: Exam-Style Black-Box Membership Inference Attacks against RAG Systems},
author = {Zelin Guan and Shengda Zhuo and Zeyan Li and Jinchun He and Wangjie Qiu and Zhiming Zheng and Shuqiang Huang},
journal= {arXiv preprint arXiv:2605.00955},
year = {2026}
}