面向预训练大语言模型的标签-only 隐身成员推断攻击
密码学与安全
2025-02-27 v1 计算与语言
摘要
隐身成员推断攻击旨在预测数据样本是否属于模型的训练集。尽管先前研究在大语言模型中广泛探索了隐身成员推断攻击,但它们通常需要访问完整的输出逻辑(即,逻辑基于攻击),在实际中通常不可用。本文我们研究预训练大语言模型对标签-only 设置下隐身成员推断攻击的脆弱性,其中对手只能访问生成的标记(文本)。我们首先揭示,现有的标签-only 隐身成员推断攻击在攻击预训练大语言模型方面效果较小,尽管它们在推断用于个性化大语言模型的微调数据集时非常有效。我们发现,这些失败的原因主要包括更好的泛化和过于粗糙的扰动。具体来说,由于预训练语料库的广泛性以及每个样本仅暴露几次,大语言模型在成员和非成员之间表现出最小的鲁棒性差异。这使得基于标记的扰动过于粗糙,无法捕捉此类差异。为缓解这些问题,我们提出了基于 **P**er-**T**oken sem**A**ntic sim**L**arity 的标签-only 隐身成员推断攻击方法 **PETAL**。具体来说,PETAL 利用基于标记的语义相似性来近似输出概率并计算困惑度。最终它基于成员更好地被记忆且困惑度更小的常见假设公开成员。我们在 WikiMIA 基准和更具挑战性的 MIMIR 基准上进行了大量实验。实证上,我们的 PETAL 在针对五个流行开源大语言模型的所有指标上,优于针对用于个性化大语言模型的现有标签-only 攻击的扩展版本,甚至与其他先进的逻辑-based 攻击相当。
引用
@article{arxiv.2502.18943,
title = {Towards Label-Only Membership Inference Attack against Pre-trained Large Language Models},
author = {Yu He and Boheng Li and Liu Liu and Zhongjie Ba and Wei Dong and Yiming Li and Zhan Qin and Kui Ren and Chun Chen},
journal= {arXiv preprint arXiv:2502.18943},
year = {2025}
}
备注
Accepted by USENIX Security 2025