微调可帮助检测大型语言模型的预训练数据
计算与语言
2025-03-18 v2 人工智能
机器学习
摘要
在大型语言模型(LLM)时代,检测预训练数据日益重要,因人们关注公平评估和伦理风险。当前方法通过设计评分函数(如困惑度和 Min-k%)来区分成员与非成员,但数据样本的多样性和复杂性加剧了区分难度,导致检测效果不佳。本文首先探索了利用不可见数据(可在 LLM 发布后轻松收集)的优势。我们发现,在使用少量先前不可见数据进行微调后,LLM 对成员和非成员的困惑度会呈现不同程度的变化。基于此,我们提出一种新颖且高效的方法,称为 Fine-tuned Score Deviation(FSD),显著提升当前评分函数在预训练数据检测中的性能。具体做法是测量在对同一领域内少量不可见数据进行微调后,当前评分的偏差距离。实际上,使用少量不可见数据可大幅降低所有非成员的评分,从而在成员与非成员之间创造更大的偏差距离。大量实验表明,我们的方法有效,显著提升了在常见基准数据集上各种模型的 AUC 分数。
引用
@article{arxiv.2410.10880,
title = {Fine-tuning can Help Detect Pretraining Data from Large Language Models},
author = {Hengxiang Zhang and Songxin Zhang and Bingyi Jing and Hongxin Wei},
journal= {arXiv preprint arXiv:2410.10880},
year = {2025}
}