中文

扩展隐私保护机器学习的规模:Llama-2-7B的CKKS实现

密码学与安全 2026-01-27 v1

摘要

随着大型语言模型(LLMs)变得无处不在,与推理输入相关的隐私问题日益增加。在此背景下,全同态加密(FHE)已成为提供非交互式机密LLM推理的主要密码学解决方案。现有解决方案在输入token长度方面的扩展性很差,因此要么专注于小型模型,要么专注于具有少量输入token的大型模型。它们还受到存在大量异常值的影响。这些值对非线性层的评估有很大影响,导致高次多项式近似,从而带来沉重的评估成本。我们提出了一种基于FHE的私有LLM推理解决方案,允许数千个输入token且仅加密其中一部分:这适用于上下文无害且仅部分输入敏感的场景。为此,我们建议采用一种非平衡分块预填充框架,以不同方式处理输入token的私有和公有部分。我们的框架包含明文-明文、明文-密文和密文-密文计算组件。我们为每个组件采用了不同的策略和要素。我们还为LLM推理过程中遇到的特定矩阵乘法和多项式评估任务设计了新的同态算法。此外,无需重新训练,我们便定制了LLM推理算法以减小异常值的范围:我们利用机器学习策略(token前置和旋转)来减轻异常值对非线性层的影响。基于这些要素,我们描述了Llama-2-7B私有推理的基于CKKS的端到端实现,支持多达4096个输入token,其中最后128个被加密。在由8块NVIDIA RTX-4090 GPU组成的集群上,摘要生成的推理耗时85秒,而每个输出token的生成耗时33秒。

关键词

引用

@article{arxiv.2601.18511,
  title  = {Scaling up Privacy-Preserving ML: A CKKS Implementation of Llama-2-7B},
  author = {Jaiyoung Park and Sejin Park and Jai Hyun Park and Jung Ho Ahn and Jung Hee Cheon and Guillaume Hanrot and Jung Woo Kim and Minje Park and Damien Stehlé},
  journal= {arXiv preprint arXiv:2601.18511},
  year   = {2026}
}