中文

基于抽样的伪似然会员推断攻击

计算与语言 2024-04-18 v1

摘要

大型语言模型(LLMs)是在大规模网络数据上训练的,这使得难以把握每段文本的贡献。这增加了泄露不当数据(如基准、个人信息和受版权保护的文本)在训练数据中的风险。会员推断攻击(MIA)用于确定给定文本是否包含在模型训练数据中,正受到广泛关注。先前的MIA研究表明,基于似然的分类对检测LLMs中的漏洞有效。然而,现有方法无法应用于某些专有模型(如ChatGPT或Claude 3),因为似然值对用户不可用。在本研究中,我们提出一种基于抽样的伪似然(Sampling-based Pseudo-Likelihood, SPL)方法,用于MIA(SaMIA),仅使用LLM生成的文本来计算SPL,以检测数据泄露。SaMIA将目标文本视为参考文本,将LLM生成的多个输出作为文本样本,计算n-gram匹配程度作为SPL,并确定文本在训练数据中的会员身份。即使没有似然值,SaMIA也能与现有的基于似然的方法相当。

关键词

引用

@article{arxiv.2404.11262,
  title  = {Sampling-based Pseudo-Likelihood for Membership Inference Attacks},
  author = {Masahiro Kaneko and Youmi Ma and Yuki Wata and Naoaki Okazaki},
  journal= {arXiv preprint arXiv:2404.11262},
  year   = {2024}
}