中文

Nob-MIAs:基于Ex-Post数据构建的大型语言模型非偏性成员推断攻击评估

密码学与安全 2025-01-17 v2

摘要

大型语言模型(LLMs)的兴起引发了法律和伦理 concerns,尤其是关于未经授权使用其训练数据集中受版权保护材料的问题。这导致针对被指控未获许可使用受保护内容的科技公司提起诉讼。成员推断攻击(MIAs)旨在检测特定文档是否用于给定的LLM预训练,但其有效性受到时间偏移和n-gram重叠等偏差的影响。本文在部分可推断训练集的情况下,针对大型语言模型上的MIAs进行评估,提出ex-post假设,即承认成员数据集和非成员数据集之间固有的分布性偏差。我们提出并验证了用于创建“非偏性”和“非可分类”数据集以实现更公平MIAs评估的算法。使用Gutenberg数据集在OpenLamma和Pythia上进行实验,表明仅中和已知偏差本身不足以实现中和。我们的方法产生的非偏性ex-post数据集的AUC-ROC分数与之前在真正随机数据集上获得的分数相当,验证了我们的方案。总体而言,MIAs的结果接近随机,只有一个在随机数据集和我们的数据集上都有效,但在消除偏差后,其性能会下降。

关键词

引用

@article{arxiv.2408.05968,
  title  = {Nob-MIAs: Non-biased Membership Inference Attacks Assessment on Large Language Models with Ex-Post Dataset Construction},
  author = {Cédric Eichler and Nathan Champeil and Nicolas Anciaux and Alexandra Bensamoun and Heber Hwang Arcolezi and José Maria De Fuentes},
  journal= {arXiv preprint arXiv:2408.05968},
  year   = {2025}
}