中文

PermLLM: 在 WAN 环境下 3 秒内进行大语言模型的私有推理

密码学与安全 2024-05-30 v1

摘要

ChatGPT 的出现标志着大语言模型 (LLM) 时代的到来。尽管 LLM 在诸多领域展示出强大能力,但也引发严重的隐私担忧,因为用户的查询会被发送到模型提供商。另一方面,将 LLM 部署在用户设备上也会泄露所有模型数据。基于安全多方计算 (MPC) 的现有方法能够保护模型参数和用户查询的隐私,但需要传输 gigabytes 数据,且仅生成一个 token 需数分钟,使其在大多数实际应用中难以实用。为提高私有 LLM 推理效率,我们提出了 PermLLM,通过使用安全随机置换加速非线性函数的求值。结合优化后的秘密共享协议和同态加密,PermLLM 在真实网络环境下(10ms RTT 和 1Gbps 带宽)实现了约 3 秒/token 的 ChatGLM-6B 模型两方私有推理,速度是现有 MPC 解决方案的几个数量级。

关键词

引用

@article{arxiv.2405.18744,
  title  = {PermLLM: Private Inference of Large Language Models within 3 Seconds under WAN},
  author = {Fei Zheng and Chaochao Chen and Zhongxuan Han and Xiaolin Zheng},
  journal= {arXiv preprint arXiv:2405.18744},
  year   = {2024}
}