分段学习中面向个性化大语言模型的模型反演:基于信息瓶颈理论的新见解
机器学习
2025-01-13 v1
摘要
面向大语言模型(LLM)的个性化部署日益增长,展现出类似 GPT-4 等模型的强大能力。这一趋势也催化了在移动设备上部署 LLM 的广泛研究。可行的边缘-云部署方法包括使用分段学习。然而,此前的研究在很大程度上忽略了来自设备到服务器的中间表示所导致的隐私泄露问题。本工作首次在大语言模型的分段学习框架中识别模型反演攻击,强调了安全防御的必要性。我们首次引入互信息熵来理解基于 Transformer 的大语言模型的信息传播,并评估大语言模型模块的隐私攻击性能。为了解决表示稀疏且包含的信息少于嵌入向量的问题,本文提出了两个阶段的攻击系统,其中第一阶段将表示投影到嵌入空间,第二阶段则使用生成模型从这些嵌入中恢复文本。该设计将复杂性分解,实现了在各种场景下 38%-75% 的攻击得分,较 SOTA 性能提升了 60% 以上。本工作全面地揭示了在边缘端部署面向个性化大语言模型时潜在的隐私风险。
引用
@article{arxiv.2501.05965,
title = {Model Inversion in Split Learning for Personalized LLMs: New Insights from Information Bottleneck Theory},
author = {Yunmeng Shu and Shaofeng Li and Tian Dong and Yan Meng and Haojin Zhu},
journal= {arXiv preprint arXiv:2501.05965},
year = {2025}
}
备注
8 pages