加密大模型推理的可扩展多 GPU 框架
密码学与安全
2025-12-15 v1 人工智能
摘要
加密 AI 使用全同态加密 (FHE) 提供强大的隐私保障;但其缓慢的性能限制了实际部署。最近的研究提出了 ASIC 来加速 FHE,但需要昂贵的先进制造工艺,这限制了其可及性。GPU 是一种更具可及性的平台,但实现 ASIC 级别的性能仍然具有挑战性。此外,当前的 state-of-the-art 方法主要关注那些能够轻松适应单个设备的小型模型。支持大型模型如 LLM 在 FHE 中引入了计算复杂度的显著增加,这需要优化的 GPU 内核,以及管理远超单个 GPU 容量的 terabyte 级内存足迹。本文提出了 Cerium,一个用于大型模型 FHE 推理的多 GPU 框架。Cerium 集成了域特定语言、优化编译器和运行时系统,用于自动生成高性能 GPU 内核、管理 terabyte 级内存足迹,并在多个 GPU 之间并行化计算。它引入了新的 IR 结构、编译器 pass、稀疏多项式表示、内存高效的数据布局和 communication-aware 并行化技术,共同实现了从小型 CNN 到 Llama3-8B 的加密推理。我们在 NVIDIA GPU 上构建了 Cerium,并演示了显著的性能提升。对于小型模型,Cerium 超过了专家编写的优化 GPU 库,提升最高可达 2.25 倍。Cerium 实现了与 state-of-the-art FHE ASIC 相当的性能,完全匹配了之前的 FHE ASIC CraterLake。它是首个在 10 毫秒以下执行引导过程的 GPU 系统,实现了 7.5 毫秒,是首个在 8 秒和 134 秒内对 BERT-Base 和 Llama3-8B 进行加密推理的系统。
引用
@article{arxiv.2512.11269,
title = {A Scalable Multi-GPU Framework for Encrypted Large-Model Inference},
author = {Siddharth Jayashankar and Joshua Kim and Michael B. Sullivan and Wenting Zheng and Dimitrios Skarlatos},
journal= {arXiv preprint arXiv:2512.11269},
year = {2025}
}