中文

UltraMemV2:参数规模达 1200 亿的记忆网络及其在长上下文学习中的优势

机器学习 2025-08-27 v1

摘要

虽然 Mixture of Experts(MoE)模型通过仅激活参数子集实现了显著的效率,但在推理期间面临高内存访问成本。记忆层架构作为一种备选方案,由于内存访问次数极少,备受青睞,但以往的尝试如 UltraMem 仅能匹配 2 专家 MoE 模型的性能,远不及最先进的 8 专家配置。我们提出 UltraMemV2,对记忆层架构进行重新设计,以缩小这一性能差距。我们的方法引入了五项关键改进:将记忆层集成到每个 transformer 块中、简化值扩展以使用单线性投影、采用来自 PEER 的 FFN 式值处理、实施原则参数初始化、以及重新平衡记忆与 FFN 计算比率。通过广泛的评估,我们展示 UltraMemV2 在相同计算量和参数下实现了与 8 专家 MoE 模型持平的性能,但显著降低了内存访问次数。值得注意的是,UltraMemV2 在记忆密集型任务上表现出优势,长上下文记忆提升 1.6 分、多轮记忆提升 6.2 分、原语学习提升 7.9 分。我们在规模化模型(总参数 1200 亿,激活参数 25 亿)处验证了该方法,并确立激活密度对性能影响大于总稀疏参数数量。我们的工作使记忆层架构达到最先进 MoE 模型的性能水平,为高效稀疏计算提供了一个具有吸引力的备选方案。

关键词

引用

@article{arxiv.2508.18756,
  title  = {UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning},
  author = {Zihao Huang and Yu Bao and Qiyang Min and Siyan Chen and Ran Guo and Hongzhi Huang and Defa Zhu and Yutao Zeng and Banggu Wu and Xun Zhou and Siyuan Qiao},
  journal= {arXiv preprint arXiv:2508.18756},
  year   = {2025}
}