中文

大语言模型中目标数据提取的成员推断有效性研究

机器学习 2026-03-02 v3 计算与语言 密码学与安全

摘要

大语言模型(LLMs)容易记忆训练数据,这带来了严重的隐私风险。两个最突出的问题是训练数据提取和成员推断攻击(MIA)。先前研究表明这些威胁是相互关联的:攻击者可以通过查询模型生成大量文本,然后应用MIA来验证某个数据点是否包含在训练集中,从而从LLM中提取训练数据。在本研究中,我们将多种MIA技术整合到数据提取流水线中,系统地基准测试它们的有效性。随后,我们将它们在这种集成设置下的表现与传统MIA基准测试结果进行比较,从而评估其在真实提取场景中的实际效用。

关键词

引用

@article{arxiv.2512.13352,
  title  = {On the Effectiveness of Membership Inference in Targeted Data Extraction from Large Language Models},
  author = {Ali Al Sahili and Ali Chehab and Razane Tajeddine},
  journal= {arXiv preprint arXiv:2512.13352},
  year   = {2026}
}

备注

This work has been accepted for publication at the IEEE Conference on Secure and Trustworthy Machine Learning (SaTML). The final version will be available on IEEE Xplore