中文

Con-ReCall:基于对比解码的大语言模型预训练数据检测

计算与语言 2025-01-16 v2

摘要

大语言模型的训练数据是其成功的关键,但也带来了隐私和安全风险,因为其中可能包含敏感信息。检测预训练数据对于缓解这些隐患至关重要。现有方法通常孤立地分析目标文本,或仅与非成员上下文一起分析,忽略了同时考虑成员和非成员上下文所能带来的潜在洞察。虽然先前的工作认为成员上下文由于引起的分布偏移很小而提供的信息甚少,但我们的分析表明,当与非成员上下文进行对比时,这些微妙的偏移可以被有效利用。在本文中,我们提出了 Con-ReCall,一种新颖的方法,通过对比解码利用成员和非成员上下文引起的非对称分布偏移,放大细微差异以增强成员推断。广泛的实证评估表明,Con-ReCall 在 WikiMIA 基准上取得了 SOTA 的性能,并且对各种文本操纵技术具有鲁棒性。

关键词

引用

@article{arxiv.2409.03363,
  title  = {Con-ReCall: Detecting Pre-training Data in LLMs via Contrastive Decoding},
  author = {Cheng Wang and Yiwei Wang and Bryan Hooi and Yujun Cai and Nanyun Peng and Kai-Wei Chang},
  journal= {arXiv preprint arXiv:2409.03363},
  year   = {2025}
}