黑箱大语言模型预训练文本的自动检测
计算与语言
2025-06-25 v1 人工智能
摘要
检测给定文本是否为大型语言模型(LLM)预训练数据的成员资格,对于确保数据隐私和版权保护至关重要。大多数现有方法依赖于 LLM 的隐藏信息(如模型参数或标记概率),在黑箱设置下(即仅可访问输入和输出文本)则无效。尽管提出了一些针对黑箱设置的方法,但它们依赖于大量的手动工作,例如设计复杂的问题或指令。为解决这些问题,我们提出了 VeilProbe,即第一个在无需人工干预的情况下自动检测 LLM 预训练文本的框架。VeilProbe 利用序列到序列映射模型推断输入文本与相应输出后缀生成的 LLM 之间的潜在映射特征。然后通过对关键标记进行扰动来获得更易辨识的成员特征。此外,考虑到实际场景中训练文本样本有限的情况,引入一种原型基的成员分类器,以缓解过拟合问题。在三个广泛使用的数据集上进行大规模评估表明,我们的框架在黑箱设置下有效且优于其他方法。
引用
@article{arxiv.2506.19399,
title = {Automated Detection of Pre-training Text in Black-box LLMs},
author = {Ruihan Hu and Yu-Ming Shang and Jiankun Peng and Wei Luo and Yazhe Wang and Xi Zhang},
journal= {arXiv preprint arXiv:2506.19399},
year = {2025}
}
备注
13 pages