分布式大语言模型推理框架上的提示推理攻击
密码学与安全
2025-05-26 v2
摘要
现代大语言模型(LLM)的推理过程需要极高的计算资源,使其难以部署在消费级设备上。为解决这一局限,近期研究提出了分布式 LLM 推理框架,利用拆分学习原理在资源受限的硬件上实现协作 LLM 推理。然而,将 LLM 层分布在各参与者之间需要传输中间输出,这可能对原始输入提示引入隐私风险——这是文献中尚未被充分探索的关键问题。在本文中,我们通过设计和评估三种旨在从中间 LLM 输出重建输入提示的提示推理攻击,严格审视了分布式 LLM 推理框架的隐私脆弱性。这些攻击在多种查询和数据约束下开发,以反映多样化的真实 LLM 服务场景。具体而言,第一种攻击假设无限的查询预算和访问与目标提示同分布的辅助数据集。第二种攻击同样利用无限查询,但使用与目标提示分布不同的辅助数据集。第三种攻击在最受限制的场景下运行,具有有限的查询预算且无可用的辅助数据集。我们在包括最先进模型(如 Llama-3.2 和 Phi-3.5)在内的多种 LLM 上评估了这些攻击,以及广泛使用的模型如 GPT-2 和 BERT 用于比较分析。我们的实验表明,前两种攻击实现了超过 90% 的重建准确率,而第三种在严格约束下通常实现了高于 50% 的准确率。这些发现凸显了分布式 LLM 推理框架中的隐私风险,对其部署到真实应用场景发出了强烈警示。
引用
@article{arxiv.2503.09291,
title = {Prompt Inference Attack on Distributed Large Language Model Inference Frameworks},
author = {Xinjian Luo and Ting Yu and Xiaokui Xiao},
journal= {arXiv preprint arXiv:2503.09291},
year = {2025}
}
备注
Accepted for publication at CCS 2025