中文

大型语言模型中成员推断攻击的统计与多视角再审视

计算与语言 2024-12-19 v1 人工智能

摘要

大型语言模型(LLM)中数据透明度的缺乏凸显了成员推断攻击(MIA)的重要性,该攻击用于区分已训练(成员)和未训练(非成员)数据。尽管在先前研究中取得了成功,但近期研究在不同设置下报告了接近随机的性能,显示出显著的性能不一致性。我们假设单一设置不能代表庞大语料库的分布,导致具有不同分布的成员和非成员被采样,从而引起不一致性。在本研究中,我们不是采用单一设置,而是从多种设置下统计性地重新审视MIA方法,对每种MIA方法进行数千次实验,同时研究文本特征、嵌入、阈值决策以及成员和非成员的解码动态。我们发现:(1)MIA性能随模型规模增大而提升,并随领域变化,但大多数方法在统计上并未优于基线;(2)尽管MIA性能普遍较低,但存在大量可区分的成员和非成员异常值,且在不同MIA方法间变化;(3)确定区分成员和非成员的阈值是一个被忽视的挑战;(4)文本差异性和长文本有利于MIA性能;(5)是否可区分反映在LLM嵌入中;(6)成员和非成员表现出不同的解码动态。

关键词

引用

@article{arxiv.2412.13475,
  title  = {A Statistical and Multi-Perspective Revisiting of the Membership Inference Attack in Large Language Models},
  author = {Bowen Chen and Namgi Han and Yusuke Miyao},
  journal= {arXiv preprint arXiv:2412.13475},
  year   = {2024}
}

备注

main content 8 pages, 6 figures