大语言模型嵌入中的信息泄露
机器学习
2024-05-24 v3 密码学与安全
摘要
大语言模型 (LLM) 的广泛应用引发了数据隐私的关注。本研究旨在调查通过输入重建攻击潜在的隐私侵入问题,即恶意模型提供者可能从嵌入中恢复用户输入。我们首先提出两种基础方法,从模型隐藏状态重建原始文本。我们发现,这两种方法在攻击浅层嵌入时有效,但在攻击深层嵌入时效果下降。为此,我们提出 Embed Parrot(基于 Transformer 的方法),用于从深层嵌入中重建输入。我们的分析表明,Embed Parrot 能有效重建 ChatGLM-6B 和 Llama2-7B 的隐藏状态,在各种 token 长度和数据分布下表现稳定。为缓解隐私泄露风险,我们引入一种防御机制以抑制嵌入重建过程的滥用。我们的发现凸显了在分布式学习系统中保护用户隐私的重要性,并为增强此类环境的安全协议提供了有价值的见解。
关键词
引用
@article{arxiv.2405.11916,
title = {Information Leakage from Embedding in Large Language Models},
author = {Zhipeng Wan and Anda Cheng and Yinggui Wang and Lei Wang},
journal= {arXiv preprint arXiv:2405.11916},
year = {2024}
}