中文

对 ENGINEERING Ingegneria Informatica S.p.A. 的 EngGPT2MoE-16B-A3B 进行基准测试评估

计算与语言 2026-05-21 v2 人工智能

摘要

本报告对 ENGINEERING Ingegneria Informatica S.p.A. 的 EngGPT2MoE-16B-A3B 大语言模型进行基准测试,该模型是拥有 160 亿参数且活跃参数为 30 亿的混合专家 (MoE) 模型。我们在广泛的代表性基准测试中考察其性能,并将其与规模相当的开源 MoE 和稠密模型进行比较。在与流行的意大利模型(FastwebMIIA-7B、Minerva-7B、Velvet-14B 和 LLaMAntino-3-ANITA-8B)进行比较时,EngGPT2MoE-16B-A3B 在国际基准测试(ARC-Challenge、GSM8K、AIME24、AIME25、MMLU 和 HumanEval)中表现与之相当或更好。它在 RULER 基准测试中最长的上下文设置 (32k) 上实现了最佳性能。在意大利基准数据集 ITALIC 上,该模型除 Velvet-14B 外,表现与其他模型相当或更好。与规模相当的流行 MoE 模型相比,新模型在所有考察的基准测试中均优于 DeepSeek-MoE-16B-Chat。相较于 Moonlight-16B-A3B,EngGPT2MoE-16B-A3B 在 HE、MMLU、AIME24、AIME25、GSM8K 和 32k RULER 设置上得分更高,但在 BFCL 和一些 ARC 和 ITALIC 设置上较低。最后,它在大多数基准测试(包括 HE、MMLU、AIME24、AIME25、GSM8K、ARC、BFCL 和 RULER 32k)中得分低于 GPT-OSS-20B。在所有基准指标综合性能比较中,EngGPT2MoE-16B-A3B 在所评估的意大利模型中表现更好,但在最具表现力的国际模型(尤其是 GPT-5 nano 和 Qwen3-8B)中表现较差。综上所述,我们发现该新模型是意大利本土大语言模型的重要进步。

关键词

引用

@article{arxiv.2605.07731,
  title  = {Benchmarking EngGPT2-16B-A3B against Comparable Italian and International Open-source LLMs},
  author = {Andrea Sassella and Andrea Chizzola and Tommaso Bianchi and Luca Alessandrelli and Mark James Carman},
  journal= {arXiv preprint arXiv:2605.07731},
  year   = {2026}
}