端到端多模态扩散 Mamba
计算机视觉与模式识别
2025-10-20 v1 人工智能
机器学习
摘要
当前端到端多模态模型利用不同的编码器和解码器处理输入和输出信息,这种分离方式阻碍了各种模态的联合表征学习。为统一多模态处理,我们提出了一种新型架构,称为 MDM(Multi-modal Diffusion Mamba)。MDM 利用基于 Mamba 的多步骤选择扩散模型,通过统一的变分自编码器逐步生成和细化特定模态的信息。这种创新方法使 MDM 在处理高维数据方面表现出优越性能,尤其在同时生成高分辨率图像和长文本序列时效果显著。我们在图像生成、图像描述、视觉问答、文本理解和推理等领域的评估表明,MDM 在与现有端到端模型(如 MonoFormer、LlamaGen、Chameleon 等)的比较中显著优于,并与 GPT-4V、Gemini Pro、Mistral 等 SOTA 模型竞争活跃。我们的结果验证了 MDM 在保持计算效率的同时统一多模态过程的有效性,为端到端多模态架构开辟了新的方向。
引用
@article{arxiv.2510.13253,
title = {End-to-End Multi-Modal Diffusion Mamba},
author = {Chunhao Lu and Qiang Lu and Meichen Dong and Jake Luo},
journal= {arXiv preprint arXiv:2510.13253},
year = {2025}
}
备注
Accepted by ICCV 2025