中文

用于实时推理的Transformer神经网络GPU加速优化

机器学习 2026-03-31 v1 分布式、并行与集群计算

摘要

本文提出并评估了使用NVIDIA TensorRT进行混合精度优化的Transformer模型GPU加速推理流水线。我们在批量大小从1到32、序列长度从32到512的范围内评估了BERT-base(110M参数)和GPT-2(124M参数)。该系统相比CPU基线实现了高达64.4倍的加速,单样本推理延迟低于10毫秒,内存使用减少63%。我们引入了一种混合精度策略,对softmax和层归一化等数值敏感操作保留FP32,对线性层应用FP16。该方法保持了高数值保真度(相对于基线输出的余弦相似度≥0.9998),并消除了NaN不稳定性。该流水线实现为模块化、容器化的系统,可在360多种配置上进行可重复的基准测试。NVIDIA A100上的跨GPU验证显示了1.84倍到2.00倍之间一致的FP16加速比,以及稳定的数值行为。SST-2的下游评估表明混合精度下无精度下降。WikiText-2的验证表明随机输入对全FP16的NaN不稳定性低估高达6倍,同时确认了混合精度方法的鲁棒性(NaN为0.0%,余弦相似度≥0.9998)。这些结果提供了GPU架构之间性能和准确性权衡的详细特征描述,并为在延迟关键环境中部署Transformer模型提供了实用指导。

关键词

引用

@article{arxiv.2603.28708,
  title  = {GPU-Accelerated Optimization of Transformer-Based Neural Networks for Real-Time Inference},
  author = {Soutrik Mukherjee and Sangwhan Cha},
  journal= {arXiv preprint arXiv:2603.28708},
  year   = {2026}
}

备注

10 pages, 8 figures, 15 tables