PUMA:五分钟内完成 LLaMA-7B 的安全推理
密码学与安全
2025-10-17 v3
摘要
以 ChatGPT 为代表,大量公司已经开始基于大型 Transformer 模型提供服务。然而,使用此类服务不可避免地会将用户的提示泄露给模型提供方。先前的研究利用安全多方计算(MPC)对 Transformer 模型的安全推理进行了探索,其中模型参数与客户端的提示均被保密。尽管如此,这些框架在模型性能、效率和部署方面仍有限制。为解决这些限制,我们提出框架 PUMA 以实现快速且安全的 Transformer 模型推理。我们的框架为 GeLU 和 softmax 等昂贵函数设计了高质量近似,在保持模型性能的同时显著降低了安全推理的成本。此外,我们设计了安全的 Embedding 和 LayerNorm 流程,在不破坏 Transformer 架构的前提下忠实实现所需功能。PUMA 比最先进的框架 MPCFORMER(ICLR 2023)快约 ,且在无需微调的情况下具有与明文模型相近的精度(先前工作未能实现)。PUMA 甚至能在约 5 分钟内评估 LLaMA-7B 以生成 1 个 token。据我们所知,这是首次有如此参数规模的模型能够在 MPC 下被评估。PUMA 已在 SecretFlow-SPU 的 Github 仓库中开源。
引用
@article{arxiv.2307.12533,
title = {PUMA: Secure Inference of LLaMA-7B in Five Minutes},
author = {Ye Dong and Wen-jie Lu and Yancheng Zheng and Haoqi Wu and Derun Zhao and Jin Tan and Zhicong Huang and Cheng Hong and Tao Wei and Wenguang Chen},
journal= {arXiv preprint arXiv:2307.12533},
year = {2025}
}