中文

EL-MIA:量化大语言模型中敏感实体的成员推断风险

机器学习 2025-11-04 v1 人工智能

摘要

成员推断攻击(MIA)旨在推断特定数据点是否属于模型的训练数据集。本文提出了大语言模型隐私语境下的一个新任务:聚焦于敏感信息(如个人可识别信息、信用卡号等)的实体级成员风险发现。现有MIA方法能够检测整个提示词或文档在LLM训练数据中的存在,但无法捕捉更细粒度的风险。我们提出了用于审计LLMs中实体级成员风险的``EL-MIA''框架。我们构建了一个用于评估该任务上MIA方法的基准数据集。通过该基准,我们系统性地比较了现有MIA技术以及两种新提出的方法。我们对结果进行全面分析,试图解释实体级MIA易受性与模型规模、训练轮数及其他表面级因素之间的关系。我们的发现表明,现有MIA方法在针对敏感属性的实体级成员推断方面受限,而这种易受性可以通过相对简单的方法来揭示,这凸显了需要更强的对手来检验所提供的威胁模型的重要性。

关键词

引用

@article{arxiv.2511.00192,
  title  = {EL-MIA: Quantifying Membership Inference Risks of Sensitive Entities in LLMs},
  author = {Ali Satvaty and Suzan Verberne and Fatih Turkmen},
  journal= {arXiv preprint arXiv:2511.00192},
  year   = {2025}
}