中文

面向预训练大语言模型的上下文感知成员推断攻击

计算与语言 2025-09-17 v2 人工智能 密码学与安全 机器学习 机器学习

摘要

针对预训练大型语言模型(LLMs)的成员推断攻击(MIAs)旨在确定某个数据点是否属于模型的训练集。针对分类模型构建的先前MIAs由于忽略LLMs在标记序列上的生成性质而在LLMs上失败。在本文中,我们提出了一种针对预训练LLMs的新型攻击方法,将MIA统计检验适应于数据点内部子序列的困惑度动态。我们的方法显著优于先前方法,揭示了预训练LLMs中上下文依赖的记忆模式。

关键词

引用

@article{arxiv.2409.13745,
  title  = {Context-Aware Membership Inference Attacks against Pre-trained Large Language Models},
  author = {Hongyan Chang and Ali Shahin Shamsabadi and Kleomenis Katevas and Hamed Haddadi and Reza Shokri},
  journal= {arXiv preprint arXiv:2409.13745},
  year   = {2025}
}