探测语言模型以检测预训练数据
计算与语言
2024-06-04 v1 人工智能
摘要
大型语言模型(LLM)展现了其令人印象深刻的能力,同时也引发了关于数据污染问题的担忧,这源于预训练阶段的隐私问题和基准数据集的泄露。因此,通过检查LLM是否在目标文本上进行了预训练来检测污染至关重要。最近的研究侧重于生成的文本并计算困惑度,这些是表面特征且不可靠。在本研究中,我们提出利用探测技术,通过检查模型的内部激活来进行预训练数据检测。我们的方法简单有效,并导致了更可信的预训练数据检测。此外,我们提出了ArxivMIA,一个新的具有挑战性的基准,包含来自计算机科学和数学类别的arxiv摘要。我们的实验表明,我们的方法优于所有基线,并在WikiMIA和ArxivMIA上均达到了最先进的性能,额外的实验证实了其有效性(我们的代码和数据集可在https://github.com/zhliu0106/probing-lm-data获取)。
引用
@article{arxiv.2406.01333,
title = {Probing Language Models for Pre-training Data Detection},
author = {Zhenhua Liu and Tong Zhu and Chuanyuan Tan and Haonan Lu and Bing Liu and Wenliang Chen},
journal= {arXiv preprint arXiv:2406.01333},
year = {2024}
}
备注
Accepted by ACL-2024 main conference