OmniMamba: 基于状态空间模型的高效统一多模态理解与生成
计算机视觉与模式识别
2025-03-12 v1
摘要
近期统一多模态理解与视觉生成(或多模态生成)模型的进展受限于其二次计算复杂度和依赖大规模训练数据的瓶颈。我们提出 OmniMamba,这是第一个基于线性架构的多模态生成模型,能够通过统一的下一个标记预测范式生成文本和图像。该模型充分利用 Mamba-2 的高计算和内存效率,将其能力从文本生成扩展到多模态生成。为解决现有统一模型的数据效率问题,我们提出了两个关键创新:(1)解耦词汇表以指导模态特定生成,(2)基于任务特定 LoRA 的参数高效适配。此外,我们引入一种解耦式双阶段训练策略,以缓解两种任务之间的数据不平衡。凭借这些技术,OmniMamba 在基准测试中表现出与 JanusFlow 相当的性能,甚至超越了 Show-o,尽管其仅使用 200 万张图像-文本对进行训练,这是 Show-o 的 1000 倍。值得注意的是,OmniMamba 在推理效率方面表现突出,相较于基于 Transformer 的模型,在长序列生成中实现了最高可达 119.2 倍的加速和 63% 的 GPU 内存降低。代码和模型已发布于 https://github.com/hustvl/OmniMamba
引用
@article{arxiv.2503.08686,
title = {OmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space Models},
author = {Jialv Zou and Bencheng Liao and Qian Zhang and Wenyu Liu and Xinggang Wang},
journal= {arXiv preprint arXiv:2503.08686},
year = {2025}
}