特殊字符攻击:从大语言模型抽取可扩展训练数据的路径
密码学与安全
2024-05-21 v2 人工智能
计算与语言
机器学习
摘要
大语言模型(LLMs)在广泛的任务中取得了显著的性能。然而,近期的研究表明,LLMs 可以记忆训练数据,简单重复的标记(tokens)会欺骗模型泄露数据。本文进一步表明,某些特殊字符或其与英文字母的组合是更强的记忆触发器,导致更严重的数据泄露。直觉是由于 LLMs 在包含大量特殊字符(如 JSON 文件的结构符号 {、},以及电子邮件和在线帖子中的 @、#)的海量数据上进行训练,模型可能记忆了这些特殊字符与原始文本之间的共现关系。这激励我们提出一种简单而有效的特殊字符攻击(Special Characters Attack, SCA)以诱发训练数据泄露。我们的实验验证了 SCA 对最新 LLMs 的高效果:它们可以泄露多样化的训练数据,包括代码语料库、网页页面以及个人可识别信息,甚至有时会生成持续不断的输出。我们进一步表明,通过检查泄露的数据可揭示训练数据语料库的组成——这对于构建高性能 LLMs 的预训练至关重要。我们的工作有助于理解 LLMs 对特殊字符的敏感性,并识别潜在的改进领域。
引用
@article{arxiv.2405.05990,
title = {Special Characters Attack: Toward Scalable Training Data Extraction From Large Language Models},
author = {Yang Bai and Ge Pei and Jindong Gu and Yong Yang and Xingjun Ma},
journal= {arXiv preprint arXiv:2405.05990},
year = {2024}
}