神经元读过你的书吗?面向大语言模型的文档级成员推断
计算与语言
2024-07-17 v2 密码学与安全
机器学习
摘要
随着大语言模型(LLM)即将嵌入我们的日常生活,关于它们所学习数据的问题开始被提出。这些问题从LLM可能从训练数据中保留的潜在偏见或错误信息,到关于人类生成文本的版权与合理使用问题。然而,当这些问题出现时,近期最先进LLM的开发者愈发不愿披露其训练语料的细节。我们在此引入真实世界LLM的文档级成员推断任务,即推断LLM在训练期间是否见过给定文档。首先,我们提出一种利用常用训练数据源和模型发布日期来开发和评估LLM文档级成员推断的流程。然后我们提出一种实用的黑盒方法来预测文档级成员关系,并在OpenLLaMA-7B上以书籍和学术论文实例化。我们展示方法表现优异,对书籍的AUC达0.856,对论文达0.678。我们随后展示我们的方法优于隐私文献中用于文档级成员任务的句子级成员推断攻击。我们进一步评估较小模型是否对文档级推断较不敏感,并显示OpenLLaMA-3B对我们的方法敏感度约与OpenLLaMA-7B相当。最后,我们考虑两种缓解策略,发现当仅考虑部分文档时AUC缓慢下降,但当模型精度降低时仍保持相当高。综上,我们的结果表明可对LLM推断准确的文档级成员关系,提升了这一将改变我们生活的技术的透明度。
引用
@article{arxiv.2310.15007,
title = {Did the Neurons Read your Book? Document-level Membership Inference for Large Language Models},
author = {Matthieu Meeus and Shubham Jain and Marek Rei and Yves-Alexandre de Montjoye},
journal= {arXiv preprint arXiv:2310.15007},
year = {2024}
}
备注
Accepted at 33rd USENIX Security Symposium (USENIX Security 2024)