CryptoMoE:通过均衡专家路由实现隐私保护且可扩展的混合专家模型推理
密码学与安全
2025-11-12 v3
摘要
基于密码学原语的私有大语言模型(LLM)推理为实现隐私保护的深度学习提供了一条有前景的路径。然而,现有框架仅支持像LLaMA-1这样的稠密LLM,难以扩展到混合专家(MoE)架构。关键挑战在于安全地评估MoE层中的动态路由机制,如果未完全保护,该机制可能会泄露敏感的输入信息。在本文中,我们提出了CryptoMoE,这是第一个能够对基于MoE的模型实现私有、高效且准确推理的框架。CryptoMoE通过均衡专家负载来保护专家路由信息,并提出了用于安全专家调度和组合的新颖协议。CryptoMoE还开发了一种置信度感知的令牌选择策略和一种批量矩阵乘法协议,以进一步提高准确性和效率。在DeepSeekMoE-16.4B、OLMoE-6.9B和QWenMoE-14.3B上的大量实验表明,与稠密基线相比,CryptoMoE实现了的端到端延迟降低和的通信量降低,且精度损失最小。我们还针对MoE推理调整了CipherPrune(ICLR'25),并证明CryptoMoE可以将通信量降低高达。代码可在以下网址获取:https://github.com/PKU-SEC-Lab/CryptoMoE。
引用
@article{arxiv.2511.01197,
title = {CryptoMoE: Privacy-Preserving and Scalable Mixture of Experts Inference via Balanced Expert Routing},
author = {Yifan Zhou and Tianshi Xu and Jue Hong and Ye Wu and Meng Li},
journal= {arXiv preprint arXiv:2511.01197},
year = {2025}
}
备注
NeurIPS 2025