中文

面向 LLM 的黑盒数据集推断

密码学与安全 2025-12-09 v3

摘要

如今,大语言模型(LLM)的训练可能涉及个人可识别信息和受版权保护的材料,从而导致数据集滥用。为缓解数据集滥用问题,本文探讨了数据集推断,旨在检测嫌疑模型 M\mathcal{M} 是否在训练中使用了受害数据集 D\mathcal{D}。以往研究通过聚合成员推断攻击的结果来解决数据集推断问题——成员推断攻击是用于确定单个样本是否属于训练数据集的方法。然而,受限于 MIA 的低准确率,以往研究要求对 M\mathcal{M} 具有灰盒访问权限以获取中间输出(概率、损失、困惑度等),从而获得满意的结果。这导致其实用性降低,因为 LLM,尤其是那些为盈利而部署的 LLM,几乎没有动力返回中间输出。在本文中,我们提出了一种仅需对目标模型进行黑盒访问(即假设仅可获得目标模型的文本回复)的数据集推断新方法。我们的方法由两组本地构建的参考模型实现,其中一组在训练中涉及 D\mathcal{D},另一组则不涉及。通过测量 M\mathcal{M} 更接近哪一组参考模型,我们确定 M\mathcal{M} 是否使用 D\mathcal{D} 进行了训练。对现实世界中实际部署的 LLM 的评估表明,我们的方法在所有设置下均具有高准确率,并且对绕过攻击表现出鲁棒性。

关键词

引用

@article{arxiv.2507.03619,
  title  = {Blackbox Dataset Inference for LLM},
  author = {Ruikai Zhou and Kang Yang and Xun Chen and Wendy Hui Wang and Guanhong Tao and Jun Xu},
  journal= {arXiv preprint arXiv:2507.03619},
  year   = {2025}
}