面向 LLM 的黑盒数据集推断
密码学与安全
2025-12-09 v3
摘要
如今,大语言模型(LLM)的训练可能涉及个人可识别信息和受版权保护的材料,从而导致数据集滥用。为缓解数据集滥用问题,本文探讨了数据集推断,旨在检测嫌疑模型 是否在训练中使用了受害数据集 。以往研究通过聚合成员推断攻击的结果来解决数据集推断问题——成员推断攻击是用于确定单个样本是否属于训练数据集的方法。然而,受限于 MIA 的低准确率,以往研究要求对 具有灰盒访问权限以获取中间输出(概率、损失、困惑度等),从而获得满意的结果。这导致其实用性降低,因为 LLM,尤其是那些为盈利而部署的 LLM,几乎没有动力返回中间输出。在本文中,我们提出了一种仅需对目标模型进行黑盒访问(即假设仅可获得目标模型的文本回复)的数据集推断新方法。我们的方法由两组本地构建的参考模型实现,其中一组在训练中涉及 ,另一组则不涉及。通过测量 更接近哪一组参考模型,我们确定 是否使用 进行了训练。对现实世界中实际部署的 LLM 的评估表明,我们的方法在所有设置下均具有高准确率,并且对绕过攻击表现出鲁棒性。
引用
@article{arxiv.2507.03619,
title = {Blackbox Dataset Inference for LLM},
author = {Ruikai Zhou and Kang Yang and Xun Chen and Wendy Hui Wang and Guanhong Tao and Jun Xu},
journal= {arXiv preprint arXiv:2507.03619},
year = {2025}
}