中文

Multiverse:语言模型暗中决定如何并行化与合并生成

机器学习 2025-06-16 v2

摘要

自回归大语言模型(AR-LLM)在顺序生成中频繁表现出隐式并行性。受此启发,我们引入了Multiverse,一种支持原生并行生成的新生成模型。Multiverse内化了MapReduce范式,通过三个阶段自动生成:(i)用于自适应任务分解的Map阶段;(ii)用于并行子任务执行的Process阶段;(iii)用于无损结果合成的Reduce阶段。接下来,我们通过数据、算法和系统的协同设计,构建了一个真实世界的Multiverse推理模型,实现了从前沿AR-LLM的快速无缝迁移。在数据创建方面,我们开发了Multiverse Curator,一个自动化的LLM辅助流水线,将顺序推理链转换为结构化训练数据,避免了昂贵的人工标注。在算法上,我们设计了Multiverse Attention,在保持与因果注意力兼容以实现高效训练的同时,分离并行推理步骤。在系统层面,我们实现了Multiverse Engine以支持并行推理。它包含一个专用解释器,可直接在模型触发下在顺序生成与并行生成之间动态切换。经过3小时微调,使用1K个样本,我们的Multiverse-32B成为唯一一个在性能上与同规模前沿AR-LLM匹敌的开源非自回归模型,AIME24和AIME25得分分别为54%和46%。此外,我们的预算控制实验表明,Multiverse-32B展现出优越的扩展性,在相同上下文长度下平均超越AR-LLM 1.87%。这种扩展进一步带来了实际效率提升,在不同批次大小下实现了高达2倍的加速。我们已开源整个Multiverse生态系统,包括数据、模型权重、引擎,以及完整的数据整理提示和详细的训练与评估方案。

关键词

引用

@article{arxiv.2506.09991,
  title  = {Multiverse: Your Language Models Secretly Decide How to Parallelize and Merge Generation},
  author = {Xinyu Yang and Yuwei An and Hongyi Liu and Tianqi Chen and Beidi Chen},
  journal= {arXiv preprint arXiv:2506.09991},
  year   = {2025}
}