中文

MaskMamba:一种用于遮蔽图像生成的混合Mamba-Transformer模型

计算机视觉与模式识别 2024-10-01 v1

摘要

图像生成模型由于依赖基于Transformer的背板,面临着可扩展性和二次复杂度的挑战。本研究中,我们引入MaskMamba,这是一种新型混合模型,结合了Mamba和Transformer架构,利用遮蔽图像建模实现非自回归图像合成。我们细致地重新设计了双向Mamba架构,通过两个关键修改实现:(1)用标准卷积替换因果卷积以更好地捕获全局上下文,(2)使用拼接而非乘法,这显著提升了性能并加速了推理速度。此外,我们探索了MaskMamba的各种混合方案,包括串行和分组并行安排。进一步地,我们纳入一种情境条件,使我们的模型能够执行类别到图像和文本到图像生成任务。我们的MaskMamba在生成质量方面优于基于Mamba和基于Transformer的模型。值得注意的是,在2048×2048分辨率下,MaskMamba相较于Transformer在推理速度上实现了惊人的54.44%的提升。

关键词

引用

@article{arxiv.2409.19937,
  title  = {MaskMamba: A Hybrid Mamba-Transformer Model for Masked Image Generation},
  author = {Wenchao Chen and Liqiang Niu and Ziyao Lu and Fandong Meng and Jie Zhou},
  journal= {arXiv preprint arXiv:2409.19937},
  year   = {2024}
}