中文

DiffuMamba:基于 Mamba 主干的高吞吐 diffusion 大语言模型

机器学习 2026-03-02 v3 人工智能

摘要

扩散语言模型(DLM)作为自回归(AR)生成的有前景替代方案,然而其依赖 Transformer 主干结构导致推理效率受限,受制于二次注意力或 KV-cache 开销。我们引入 DiffuMamba,基于双向 Mamba 主干构建的掩码扩散语言模型,将扩散目标与线性时间序列建模相结合,以及 DiffuMamba-H,一种交错注意力的混合变体。跨 13 亿参数规模,我们的模型在下游任务性能上与基于 Transformer 的扩散模型持相当水平,同时在长序列上的推理吞吐量分别提升了最高达 8.2 倍和 4.3 倍。我们进一步呈现了现代 DLM 变体推理效率的系统性分析,将渐近复杂度与实证测量相结合。值得注意的是,cache 高效的块状扩散搭配 Mamba 混合器是唯一一种随序列长度线性扩展并在所有基准中实现最佳性能的策略,这表明这是未来基于扩散的生成系统的有前景方向。

关键词

引用

@article{arxiv.2511.15927,
  title  = {DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone},
  author = {Vaibhav Singh and Oleksiy Ostapenko and Pierre-André Noël and Eugene Belilovsky and Torsten Scholak},
  journal= {arXiv preprint arXiv:2511.15927},
  year   = {2026}
}

备注

8 pages, 3 figures