MaskMamba:一种用于遮蔽图像生成的混合Mamba-Transformer模型
计算机视觉与模式识别
2024-10-01 v1
摘要
图像生成模型由于依赖基于Transformer的背板,面临着可扩展性和二次复杂度的挑战。本研究中,我们引入MaskMamba,这是一种新型混合模型,结合了Mamba和Transformer架构,利用遮蔽图像建模实现非自回归图像合成。我们细致地重新设计了双向Mamba架构,通过两个关键修改实现:(1)用标准卷积替换因果卷积以更好地捕获全局上下文,(2)使用拼接而非乘法,这显著提升了性能并加速了推理速度。此外,我们探索了MaskMamba的各种混合方案,包括串行和分组并行安排。进一步地,我们纳入一种情境条件,使我们的模型能够执行类别到图像和文本到图像生成任务。我们的MaskMamba在生成质量方面优于基于Mamba和基于Transformer的模型。值得注意的是,在2048×2048分辨率下,MaskMamba相较于Transformer在推理速度上实现了惊人的54.44%的提升。
关键词
引用
@article{arxiv.2409.19937,
title = {MaskMamba: A Hybrid Mamba-Transformer Model for Masked Image Generation},
author = {Wenchao Chen and Liqiang Niu and Ziyao Lu and Fandong Meng and Jie Zhou},
journal= {arXiv preprint arXiv:2409.19937},
year = {2024}
}