中文

ZAYA1-8B 技术报告

人工智能 2026-05-08 v1 计算与语言

摘要

我们介绍 ZAYA1-8B,这是一个基于 Zyphra MoE++ 架构构建的、具有 700M 活跃参数和 8B 总参数的推理专注混合专家 (MoE) 模型。ZAYA1-8B 的核心预训练、中期训练和监督微调 (SFT) 在完整的 AMD 计算、网络和软件平台上完成。在激活参数不足 10 亿的情况下,ZAYA1-8B 在多个具有挑战性的数学和编码基准测试中匹配或超越 DeepSeek-R1-0528,同时保持与规模更大的开源推理模型的竞争力。ZAYA1-8B 从头开始训练以进行推理,预训练阶段始终包含推理数据,通过一种保持答案完整性的修剪方案进行。后训练使用四阶段强化学习级联:针对数学和谜题的推理热身;400 项 RLVE-Gym 课程;数学和代码 RL 采用测试时计算轨迹和来自竞赛编程参考构建的合成代码环境;以及针对聊天和指令遵循的行为 RL。我们还引入了 Markovian RSA,这是一种测试时计算方法,通过递归聚合平行推理轨迹,仅携带受限长度的推理尾部在各轮之间进行交叉。TTC 评估中,Markovian RSA 将 ZAYA1-8B 提升至 AIME'25 的 91.9% 和 HMMT'25 的 89.6%,同时仅携带 4K token 的尾部,缩小了与 Gemini-2.5 Pro、DeepSeek-V3.2 和 GPT-5-High 等规模更大的推理模型之间的差距。

关键词

引用

@article{arxiv.2605.05365,
  title  = {ZAYA1-8B Technical Report},
  author = {Robert Washbourne and Rishi Iyer and Tomas Figliolia and Henry Zheng and Ryan Lorig-Roach and Sungyeon Yang and Pritish Yuvraj and Quentin Anthony and Yury Tokpanov and Xiao Yang and Ganesh Nanduru and Stephen Ebert and Praneeth Medepalli and Skyler Szot and Srivatsan Rajagopal and Alex Ong and Bhavana Mehta and Beren Millidge},
  journal= {arXiv preprint arXiv:2605.05365},
  year   = {2026}
}