中文

EngGPT2:主权、高效且开放的人工智能

计算与语言 2026-03-31 v3 人工智能

摘要

EngGPT2-16B-A3B 是工程集团最新推出的意大利语言大模型,旨在实现主权、高效与开放。EngGPT2 采用 2.5 万亿 token 训练,参数量不及 Qwen3 的 36T 或 Llama3 的 15T,但在 MMLU-Pro、GSM8K、IFEval 和 HumanEval 等关键基准测试上性能与 8B-16B 范围内的稠密模型相当,推理功耗仅为其的一-fifth 到 one-half,训练数据及其所需训练功耗也仅为其的 one-tenth 到 one-sixth。作为从头训练的混合专家(MoE)架构,EngGPT2 拥有 160 亿参数,推理时仅激活 30 亿参数,专家规模位于 GPT-OSS 与 Qwen3 之间。约 25% 的训练语料为意大利语数据,以在规模相似的模型中为欧洲及意大利 NLP 任务提供强大能力。这种效率旨在将 EngGPT2 定位为日益增长的开源欧洲模型组合中的关键力量,兼具性能与效率,同时完全遵循欧盟 AI 法规。EngGPT2 也是一种单一模型,支持多种推理模式:非推理、意大利语或英文推理,以及 turbo 推理(以简洁要点式推理呈现,两种语言均可,用于实时推理场景)。EngGPT2 旨在为面向欧洲及意大利语境的资源导向、高性能大模型树立新标准。

关键词

引用

@article{arxiv.2603.16430,
  title  = {EngGPT2: Sovereign, Efficient and Open Intelligence},
  author = {G. Ciarfaglia and A. Rosanova and S. Cipolla and J. Bartoli and A. Di Domenico and C. Fioroni and A. Fontana and M. R. Scoleri and M. I. Mone and D. Franchi and M. C. Del Gaudio and A. Leodori and F. Cinti and M. Capozzi and C. Baston and F. Picariello and M. Gabusi and S. Bonura and V. Morreale and I. Bailo},
  journal= {arXiv preprint arXiv:2603.16430},
  year   = {2026}
}