中文

NVIDIA Hopper GPU 上的保密计算:性能基准研究

分布式、并行与集群计算 2024-11-06 v4 人工智能 性能

摘要

本报告评估了在 NVIDIA Hopper GPU 上启用受信执行环境 (TEE) 后,对大型语言模型 (LLM) 推理任务所产生的性能影响。我们对 TEE 模式在各种 LLM 和不同 token 长度下的开销进行基准测试,重点关注通过 PCIe 进行的 CPU-GPU 数据传输所导致的瓶颈。我们的结果表明,尽管 GPU 内部存在最小的计算开销,但整体性能惩罚主要归因于数据传输。对于大多数典型 LLM 查询,开销仍在 7% 以下,较大模型和更长序列则几乎没有开销。

关键词

引用

@article{arxiv.2409.03992,
  title  = {Confidential Computing on NVIDIA Hopper GPUs: A Performance Benchmark Study},
  author = {Jianwei Zhu and Hang Yin and Peng Deng and Aline Almeida and Shunfan Zhou},
  journal= {arXiv preprint arXiv:2409.03992},
  year   = {2024}
}