基础模型推理能力的跨平台评估
人工智能
2025-10-31 v1 计算与语言
摘要
本文提出了对当代基础模型推理能力进行的全面跨平台评估,建立了一个无需特定基础设施的基准测试,覆盖三个计算范式:HPC 超级计算机 (MareNostrum 5)、云平台 (Nebius AI Studio) 和大学集群 (一个配备八个 H200 GPU 的节点)。我们在 79 个问题上评估了 15 个基础模型,涵盖八个学术领域 (物理学、数学、化学、经济学、生物学、统计学、微积分和优化)。通过三个实验阶段进行评估:(1) 基线建立:在 MareNostrum 5 上对六个模型 (Mixtral-8x7B、Phi-3、LLaMA 3.1-8B、Gemma-2-9b、Mistral-7B、OLMo-7B) 使用 19 个问题进行评估,确立方法并建立参考性能;(2) 基础设施验证:在大学集群上重复 19 个问题的基准测试(包括七个模型,如 Falcon-Mamba 状态空间架构)以及 Nebius AI Studio(包括九个最先进模型:Hermes-4 70B/405B、LLaMA 3.1-405B/3.3-70B、Qwen3 30B/235B、DeepSeek-R1、GPT-OSS 20B/120B)以确认基础设施无关的可重复性;(3) 扩展评估:在大学集群和 Nebius 平台上进行完整的 79 个问题评估,探索在架构多样性下的泛化能力。我们的发现挑战了传统的规模假设,确立了训练数据质量比模型规模更为关键,并为教育、生产和科研背景下的模型选择提供了可操作的指导方针。该三基础设施方法和 79 问题基准测试使我们能够随着基础模型的演进,对推理能力进行纵向跟踪。
引用
@article{arxiv.2510.26732,
title = {Cross-Platform Evaluation of Reasoning Capabilities in Foundation Models},
author = {J. de Curtò and I. de Zarzà and Pablo García and Jordi Cabot},
journal= {arXiv preprint arXiv:2510.26732},
year = {2025}
}