语言模型可能逐字完成其未显式训练的文本
计算与语言
2025-03-26 v2 人工智能
密码学与安全
机器学习
摘要
今天的一个重要问题是确定给定文本是否用于训练大型语言模型(LLM)。常采用“完成测试”方法:检查 LLM 是否完成足够复杂的文本。这需要一个关于成员身份的准确定义;最常见的做法是基于目标文本与数据集中任何文本之间的 n 元agram 重叠来定义成员身份。在本工作中,我们展示这种基于 n 元agram的成员身份定义可以被有效地游戏化。我们研究了序列是非成员的情况(对于给定的 n),我们发现完成测试仍然成功。我们通过从头重新训练 LLM 并删除所有被完成的训练样本来发现许多自然的这种现象的案例,这些案例包括完全重复、近似重复,甚至短暂重叠。这表明为成员身份定义找到单一可行的 n 值极其困难。借助这些见解,我们设计了对抗性数据集,使给定的目标序列可以在不包含它的前提下被完成,对于任何合理的 n 值都如此。我们的发现凸显了基于 n gram 成员身份的不足,表明成员身份定义未能考虑训练算法可获得的辅助信息。
引用
@article{arxiv.2503.17514,
title = {Language Models May Verbatim Complete Text They Were Not Explicitly Trained On},
author = {Ken Ziyu Liu and Christopher A. Choquette-Choo and Matthew Jagielski and Peter Kairouz and Sanmi Koyejo and Percy Liang and Nicolas Papernot},
journal= {arXiv preprint arXiv:2503.17514},
year = {2025}
}
备注
Main text: 9 pages, 7 figures, 1 table. Appendix: 29 pages, 20 tables, 15 figures