中文

Comet:通过预测激活稀疏性加速大语言模型隐私推理

密码学与安全 2025-05-13 v1 人工智能

摘要

随着托管在云平台上的大语言模型(LLM)越来越多地用于提供推理服务,对敏感信息潜在泄露的隐私担忧日益加剧。安全多方计算(MPC)是一种保护LLM推理隐私的有前景的解决方案。然而,MPC需要频繁的服务器间通信,导致高昂的性能开销。受LLM中普遍存在的激活稀疏性(即大多数神经元在非线性激活函数后未被激活)的启发,我们提出了一种高效的隐私推理系统Comet。该系统采用一个准确且快速的预测器来预测激活函数输出的稀疏分布。此外,我们引入了一种新的隐私推理协议。它通过利用预测的稀疏分布的空间局部性,高效且安全地避免涉及零值的计算。虽然这种避免计算的方法影响了KV缓存条目的时空连续性,但我们通过一种低通信开销的缓存重填策略来应对这一挑战,该策略合并了缺失请求并引入了预取机制。最后,我们在四个常见的LLM上评估了Comet,并将其与六个最先进的隐私推理系统进行了比较。Comet实现了1.87倍至2.63倍的加速和1.94倍至2.64倍的通信量减少。

关键词

引用

@article{arxiv.2505.07239,
  title  = {Comet: Accelerating Private Inference for Large Language Model by Predicting Activation Sparsity},
  author = {Guang Yan and Yuhui Zhang and Zimu Guo and Lutan Zhao and Xiaojun Chen and Chen Wang and Wenhao Wang and Dan Meng and Rui Hou},
  journal= {arXiv preprint arXiv:2505.07239},
  year   = {2025}
}

备注

Accepted to SP 2025