中文

SMA:谁说的? semi-black-box RAG 控制下的成员推断审计

人工智能 2025-08-14 v2

摘要

检索增强生成(RAG)及其多模态检索增强生成(MRAG)通过引入外部知识源显著提升了大型语言模型(LLM)的知识覆盖范围和上下文理解能力。然而,检索和多模态融合模糊了内容来源,导致现有成员推断方法无法可靠地将生成输出归因于预训练、外部检索或用户输入,从而削弱了隐私泄露责任归属。为此,我们提出首个源知觉成员审计(SMA),在具有检索控制能力的semi-black-box环境中实现对生成内容的细粒度来源归因。为解决semi-black-box审计的环境限制,我们进一步设计了基于零阶优化的归因估计机制,通过大规模扰动抽样和岭回归建模来稳健地近似输入标记对输出的真实影响。在此基础上,SMA引入了跨模态归因技术,通过MLLM将图像输入投影为文本描述,实现文本模态下的token级归因,首次实现对MRAG系统中图像检索痕迹的成员推断。本工作将成员推断的关注点从'数据是否被记忆'转向'内容来自何处',为复杂生成系统的数据来源审计提供了新视角。

关键词

引用

@article{arxiv.2508.09105,
  title  = {SMA: Who Said That? Auditing Membership Leakage in Semi-Black-box RAG Controlling},
  author = {Shixuan Sun and Siyuan Liang and Ruoyu Chen and Jianjie Huang and Jingzhi Li and Xiaochun Cao},
  journal= {arXiv preprint arXiv:2508.09105},
  year   = {2025}
}