Alpaca 对抗 Vicuna:使用 LLM 揭示 LLM 的记忆
计算与语言
2025-02-11 v3
摘要
在本文中,我们引入了一种黑盒提示优化方法,该方法使用攻击者 LLM 智能体来揭示受害者智能体中更高水平的记忆,相比之下,直接用训练数据提示目标模型(这是量化 LLM 中记忆的主导方法)所揭示的则较少。我们使用迭代拒绝采样优化过程来寻找具有两个主要特征的基于指令的提示:(1)与训练数据的最小重叠,以避免直接向模型呈现解决方案,以及(2)受害者模型输出与训练数据之间的最大重叠,旨在诱导受害者吐出训练数据。我们观察到,与基线前缀-后缀测量相比,我们基于指令的提示生成的输出与训练数据的重叠率高出 23.7%。我们的研究结果表明:(1)指令微调模型暴露的预训练数据与其基础模型一样多,甚至更多,(2)原始训练数据以外的上下文也可能导致泄漏,(3)使用其他 LLM 提出的指令可以开辟一条我们应进一步研究和探索的自动化攻击新途径。代码可在 https://github.com/Alymostafa/Instruction_based_attack 找到。
引用
@article{arxiv.2403.04801,
title = {Alpaca against Vicuna: Using LLMs to Uncover Memorization of LLMs},
author = {Aly M. Kassem and Omar Mahmoud and Niloofar Mireshghallah and Hyunwoo Kim and Yulia Tsvetkov and Yejin Choi and Sherif Saad and Santu Rana},
journal= {arXiv preprint arXiv:2403.04801},
year = {2025}
}