中文

真实环境下的 LLM 成员推理攻击

计算与语言 2026-01-19 v1

摘要

成员推理攻击(MIA)是审计大型语言模型(LLM)不透明训练数据的关键工具。然而,现有技术主要依赖于不可访问的模型内部信息(如 logits),或者在仅可获得生成文本的严格黑盒设置中存在跨领域泛化性差的问题。在本研究中,我们提出了 SimMIA,这是一种通过采用先进的采样策略和评分机制,专为这种纯文本场景量身定制的鲁棒 MIA 框架。此外,我们提出了 WikiMIA-25,一个专门为评估现代专有 LLM 上 MIA 性能而构建的新基准。实验表明,SimMIA 在黑盒设置中取得了 SOTA 结果,可与利用模型内部信息的基线方法相媲美。

关键词

引用

@article{arxiv.2601.11314,
  title  = {Membership Inference on LLMs in the Wild},
  author = {Jiatong Yi and Yanyang Li},
  journal= {arXiv preprint arXiv:2601.11314},
  year   = {2026}
}