GPT-OSS-20B:面向开放权重混合专家模型的全面部署分析
硬件体系结构
2025-09-03 v2 人工智能
分布式、并行与集群计算
性能
摘要
我们对GPT-OSS-20B(混合专家模型;总计20.9B参数,约3.61B活跃参数)在单GPU(H100,bf16)上的进行了全面评估,针对Qwen3-32B和Yi-34B等稠密基线模型进行了多维度对比测试。我们测量了真实的首次token延迟(TTFT)、完整解码吞吐量(TPOT)、端到端延迟分位值、峰值VRAM(保留past key values)以及能源消耗,通过一致的nvidia-smi采样器进行测量。在2048 token上下文和64 token解码的情况下,GPT-OSS-20B在解码吞吐量和每瓦特生成token数方面均高于稠密基线Qwen3-32B和Yi-34B,同时显著降低了峰值VRAM和每1000个生成token的能源消耗;其TTFT较高是由于MoE路由开销所致。仅使用17.3%的活跃参数(3.61B的20.9B),GPT-OSS-20B在2048/64配置下比Qwen3-32B的解码吞吐量高出31.8%,每1000个生成token的能源消耗降低25.8%,同时使用31.7%更少的峰值VRAM。按活跃参数标准化后,GPT-OSS-20B在每活跃参数效率(APE)方面显著优于稠密模型,这凸显了MoE在部署方面的优势。我们未评估模型准确性,这是一项以部署为导向的研究。我们发布代码和汇总结果,以便复制和延伸。
引用
@article{arxiv.2508.16700,
title = {GPT-OSS-20B: A Comprehensive Deployment-Centric Analysis of OpenAI's Open-Weight Mixture of Experts Model},
author = {Deepak Kumar and Divakar Yadav and Yash Patel},
journal= {arXiv preprint arXiv:2508.16700},
year = {2025}
}