中文

SecureInfer:面向大语言模型部署的隐私关键张量异构 TEE-GPU 架构

密码学与安全 2025-10-24 v1 机器学习 软件工程

摘要

随着大语言模型(LLM)在移动端与边缘平台上的部署日益广泛,针对模型提取攻击对其进行保护已成为一项紧迫的需求。然而,在不牺牲不可信 AI 加速器(如 GPU)所带来的性能优势的前提下保护模型隐私,是一项极具挑战性的权衡。本文开启了对大语言模型高性能执行的研究,提出了 SecureInfer——一种利用异构可信执行环境(TEE)-GPU 架构的混合框架,用于隔离隐私关键组件,同时将计算密集型操作卸载到不可信加速器。SecureInfer 基于外包方案,采用信息论驱动且威胁知情的划分策略:包括非线性层、注意力头投影、FNN 变换以及 LoRA 适配器在内的安全敏感组件在 SGX Enclave 内执行,而其他线性操作(矩阵乘法)则在加密后于 GPU 上执行,并在 Enclave 内安全恢复。我们使用 LLaMA-2 模型实现了 SecureInfer 的原型,并从性能与安全两方面对其进行了评估。结果表明,SecureInfer 在保持合理性能的同时提供了强大的安全保障,为安全的端侧模型推理提供了一种切实可行的方案。

关键词

引用

@article{arxiv.2510.19979,
  title  = {SecureInfer: Heterogeneous TEE-GPU Architecture for Privacy-Critical Tensors for Large Language Model Deployment},
  author = {Tushar Nayan and Ziqi Zhang and Ruimin Sun},
  journal= {arXiv preprint arXiv:2510.19979},
  year   = {2025}
}

备注

Accepted at IEEE Intelligent Computing and Systems at the Edge (ICEdge) 2025