中文

MIA-Tuner:将大型语言模型适配为预训练文本检测器

计算与语言 2024-12-30 v1 密码学与安全 机器学习

摘要

大型语言模型(LLM)参数和数据集规模的不断扩大,凸显了对审计 LLM 底层隐私风险和版权问题的技术解决方案的迫切需求。现有研究通过探索预训练数据检测问题部分满足了这一需求,这是成员推断攻击(MIA)的一个实例。该问题涉及判断给定文本是否在目标 LLM 的预训练阶段被使用。尽管现有方法设计了各种复杂的 MIA 评分函数以在预训练 LLM 中实现可观的检测性能,但如何实现高置信度检测以及如何对经过对齐的 LLM 进行 MIA 仍然具有挑战性。在本文中,我们提出了 MIA-Tuner,一种基于指令的 MIA 方法,通过指令让 LLM 自身作为更精确的预训练数据检测器在内部运作,而非设计外部 MIA 评分函数。此外,我们设计了两种基于指令的保护措施,分别缓解现有方法和 MIA-Tuner 带来的隐私风险。为了全面评估最新的最先进 LLM,我们收集了一个更新的 MIA 基准数据集 WIKIMIA-24,以取代广泛采用的基准 WIKIMIA。我们在两个基准数据集上对各种经过对齐和未对齐的 LLM 进行了广泛实验。结果表明,MIA-Tuner 将 MIA 的 AUC 从 0.7 显著提升至 0.9。

关键词

引用

@article{arxiv.2408.08661,
  title  = {MIA-Tuner: Adapting Large Language Models as Pre-training Text Detector},
  author = {Wenjie Fu and Huandong Wang and Chen Gao and Guanghua Liu and Yong Li and Tao Jiang},
  journal= {arXiv preprint arXiv:2408.08661},
  year   = {2024}
}

备注

code and dataset: https://github.com/wjfu99/MIA-Tuner