面向预训练大语言模型的上下文感知成员推断攻击
计算与语言
2025-09-17 v2 人工智能
密码学与安全
机器学习
机器学习
摘要
针对预训练大型语言模型(LLMs)的成员推断攻击(MIAs)旨在确定某个数据点是否属于模型的训练集。针对分类模型构建的先前MIAs由于忽略LLMs在标记序列上的生成性质而在LLMs上失败。在本文中,我们提出了一种针对预训练LLMs的新型攻击方法,将MIA统计检验适应于数据点内部子序列的困惑度动态。我们的方法显著优于先前方法,揭示了预训练LLMs中上下文依赖的记忆模式。
引用
@article{arxiv.2409.13745,
title = {Context-Aware Membership Inference Attacks against Pre-trained Large Language Models},
author = {Hongyan Chang and Ali Shahin Shamsabadi and Kleomenis Katevas and Hamed Haddadi and Reza Shokri},
journal= {arXiv preprint arXiv:2409.13745},
year = {2025}
}