中文

CryptoMoE:通过均衡专家路由实现隐私保护且可扩展的混合专家模型推理

密码学与安全 2025-11-12 v3

摘要

基于密码学原语的私有大语言模型(LLM)推理为实现隐私保护的深度学习提供了一条有前景的路径。然而,现有框架仅支持像LLaMA-1这样的稠密LLM,难以扩展到混合专家(MoE)架构。关键挑战在于安全地评估MoE层中的动态路由机制,如果未完全保护,该机制可能会泄露敏感的输入信息。在本文中,我们提出了CryptoMoE,这是第一个能够对基于MoE的模型实现私有、高效且准确推理的框架。CryptoMoE通过均衡专家负载来保护专家路由信息,并提出了用于安全专家调度和组合的新颖协议。CryptoMoE还开发了一种置信度感知的令牌选择策略和一种批量矩阵乘法协议,以进一步提高准确性和效率。在DeepSeekMoE-16.4B、OLMoE-6.9B和QWenMoE-14.3B上的大量实验表明,与稠密基线相比,CryptoMoE实现了2.83.5×2.8\sim3.5\times的端到端延迟降低和2.94.3×2.9\sim4.3\times的通信量降低,且精度损失最小。我们还针对MoE推理调整了CipherPrune(ICLR'25),并证明CryptoMoE可以将通信量降低高达4.3×4.3 \times。代码可在以下网址获取:https://github.com/PKU-SEC-Lab/CryptoMoE。

关键词

引用

@article{arxiv.2511.01197,
  title  = {CryptoMoE: Privacy-Preserving and Scalable Mixture of Experts Inference via Balanced Expert Routing},
  author = {Yifan Zhou and Tianshi Xu and Jue Hong and Ye Wu and Meng Li},
  journal= {arXiv preprint arXiv:2511.01197},
  year   = {2025}
}

备注

NeurIPS 2025