中文

面向非公开大型语言模型的训练数据痕迹信息导向识别

计算与语言 2025-03-18 v1

摘要

高质量的训练数据已被证明对于开发高性能的大型语言模型(LLM)至关重要。然而,商业型 LLM 提供商几乎不透露用于训练的数据细节。这种缺乏透明度带来了多个挑战:它限制了对 LLM 进行外部监督和检查,以识别如版权侵权等问题;它削弱了数据作者的能动性;它阻碍了对数据污染和数据选择等关键问题的科学研究。我们如何恢复已知被 LLM 识别的训练数据呢?本文演示了一种新方法,用于识别非公开的 LLM(如 GPT-4)中已知的训练数据,而无需访问模型权重或标记概率。我们的工作建立在一个关键观察之上:具有高惊讶值(surprisal)的文本片段是记忆探针的优质搜索材料。通过评估模型在文本中成功重构高惊讶值标记的能力,我们可以识别出 LLM 记忆的大量文本。

关键词

引用

@article{arxiv.2503.12072,
  title  = {Information-Guided Identification of Training Data Imprint in (Proprietary) Large Language Models},
  author = {Abhilasha Ravichander and Jillian Fisher and Taylor Sorensen and Ximing Lu and Yuchen Lin and Maria Antoniak and Niloofar Mireshghallah and Chandra Bhagavatula and Yejin Choi},
  journal= {arXiv preprint arXiv:2503.12072},
  year   = {2025}
}

备注

NAACL 2025