GPT-OSS好吗?对OpenAI最新开源模型的全面评估
计算与语言
2025-12-16 v3
摘要
2025年8月,OpenAI发布了GPT-OSS模型,自2019年GPT-2以来其首个开源权重大语言模型,包含两种稀疏混合专家架构,参数量分别为120B和20B。我们对两种变体均在十个基准测试中对比评估了六个当代开源大语言模型,参数规模从14.7B到235B,涵盖稠密和稀疏设计,测试内容涉及通用知识、数学推理、代码生成、多语言理解和对话能力。所有模型均在未量化形式下采用标准化推理设置进行测试,并使用McNemar检验和效应大小分析进行统计验证。结果显示,gpt-oss-20B在多个基准测试中(如HumanEval和MMLU) consistently优于gpt-oss-120B,尽管后者在响应时的内存和能源消耗显著更低。两个模型在当前开源生态系统中整体表现属于中等水平,在代码生成方面表现突出,但在多语言任务方面存在显著弱点。这些发现提供了关于稀疏架构规模化是否产生比例性能提升的实证证据,强调了进一步探索优化策略的必要性,并为未来开源部署的模型选择提供了更高效的决策依据。更多细节和评估脚本可在https://ai-agent-lab.github.io/gpt-oss获取(项目网页)。
引用
@article{arxiv.2508.12461,
title = {Is GPT-OSS Good? A Comprehensive Evaluation of OpenAI's Latest Open Source Models},
author = {Ziqian Bi and Keyu Chen and Chiung-Yi Tseng and Danyang Zhang and Tianyang Wang and Hongying Luo and Lu Chen and Junming Huang and Jibin Guan and Junfeng Hao and Xinyuan Song and Junhao Song},
journal= {arXiv preprint arXiv:2508.12461},
year = {2025}
}