中文

多样本反刍 (MSR) 提示

计算与语言 2024-05-15 v1

摘要

我们引入了多样本反刍 (MSR) 提示,这是一种用于检查大语言模型 (LLM) 中逐字内容复现的新型黑盒成员推理攻击框架。MSR 提示涉及将输入文本划分为多个片段,并创建一个包含用户与语言模型之间一系列虚假对话轮次的单一提示,以诱导逐字反刍。我们将 MSR 提示应用于多种文本来源,包括维基百科文章和开放教育资源 (OER) 教科书,这些来源提供高质量、事实性内容并随时间不断更新。对于每个来源,我们策划两种数据集类型:一种是 LLM 在训练期间可能接触过的数据集 (DpreD_{\rm pre}),另一种由在模型训练截止日期之后发布的文档组成的数据集 (DpostD_{\rm post})。为了量化逐字匹配的发生率,我们采用最长公共子串算法并计算不同长度阈值下的匹配频率。然后,我们使用 Cliff's delta、Kolmogorov-Smirnov (KS) 距离和 Kruskal-Wallis H 检验等统计测度,来确定 DpreD_{\rm pre}DpostD_{\rm post} 之间逐字匹配的分布是否存在显著差异。我们的结果揭示了 DpreD_{\rm pre}DpostD_{\rm post} 之间逐字匹配分布的显著差异,当 LLM(例如 GPT 模型和 LLaMAs)接收到可能来自其训练数据集的文本提示时,逐字复现的频率显著更高。例如,在维基百科文章上使用 GPT-3.5 时,我们观察到 DpreD_{\rm pre}DpostD_{\rm post} 分布之间存在巨大的效应量(Cliff's delta =0.984= -0.984)和较大的 KS 距离(0.8750.875)。我们的结果提供了令人信服的证据,表明当输入文本可能源自其训练数据时,LLM 更容易逐字复现内容。

关键词

引用

@article{arxiv.2405.08134,
  title  = {Many-Shot Regurgitation (MSR) Prompting},
  author = {Shashank Sonkar and Richard G. Baraniuk},
  journal= {arXiv preprint arXiv:2405.08134},
  year   = {2024}
}