Min-K%++:改进的大语言模型预训练数据检测基线
计算与语言
2025-02-13 v4 机器学习
摘要
由于涉及版权侵权和测试数据污染等关键问题,大语言模型(LLMs)的预训练数据检测问题日益受到关注。尽管性能有所提升,但现有方法(包括最先进的 Min-K%)大多基于简单的启发式方法开发,缺乏坚实、合理的基础。在这项工作中,我们提出了一种新颖且有理论动机的预训练数据检测方法,命名为 Min-K%++。具体而言,我们提出了一个关键见解:通过最大似然训练,训练样本倾向于成为建模分布沿每个输入维度的局部最大值,这反过来使我们能够深刻地将该问题转化为局部最大值的识别。然后,我们相应地设计了在 LLMs 建模的离散分布下工作的方法,其核心思想是确定输入是否在条件类别分布下形成一个众数或具有相对较高的概率。在经验上,所提出的方法在多种设置下取得了新的 SOTA 性能。在 WikiMIA 基准上,Min-K%++ 在五个模型的平均检测 AUROC 上比第二名高出 6.2% 到 10.5%。在更具挑战性的 MIMIR 基准上,它持续改进无参考方法,同时与需要额外参考模型的基于参考的方法表现相当。
引用
@article{arxiv.2404.02936,
title = {Min-K%++: Improved Baseline for Detecting Pre-Training Data from Large Language Models},
author = {Jingyang Zhang and Jingwei Sun and Eric Yeats and Yang Ouyang and Martin Kuo and Jianyi Zhang and Hao Frank Yang and Hai Li},
journal= {arXiv preprint arXiv:2404.02936},
year = {2025}
}
备注
ICLR'25 Spotlight. Project page and code is available at https://zjysteven.github.io/mink-plus-plus/