DiM:高分辨率图像合成的高效扩散 Mamba
计算机视觉与模式识别
2024-07-11 v2
摘要
扩散模型在图像生成领域取得了巨大成功,然而其背bone(U-Net 向视觉 Transformer 演进)的计算成本随 token 数量呈二次增长,导致在处理高分辨率图像时面临显著挑战。本文提出 Diffusion Mamba(DiM),将基于状态空间模型(SSM)的 Mamba 高效性与扩散模型的表达能力相结合,用于高效高分辨率图像合成。为解决 Mamba 无法泛化到 2D 信号的问题,我们进行了多项架构设计,包括多方向扫描、每行和每列末端可学习的填充 token,以及轻量级局部特征增强。我们的 DiM 架构实现了高分辨率图像的推理时效益。此外,为进一步提升高分辨率图像生成的训练效率,我们探索了从低分辨率图像()预训练再微调到高分辨率图像()的"弱到强"训练策略。我们进一步探索训练-free 上采样策略,以实现无需进一步微调即可生成更高分辨率图像(如 和 )。实验表明,我们的 DiM 在有效性和效率方面均表现出色。我们的工作代码已公开:https://github.com/tyshiwo1/DiM-DiffusionMamba/。
引用
@article{arxiv.2405.14224,
title = {DiM: Diffusion Mamba for Efficient High-Resolution Image Synthesis},
author = {Yao Teng and Yue Wu and Han Shi and Xuefei Ning and Guohao Dai and Yu Wang and Zhenguo Li and Xihui Liu},
journal= {arXiv preprint arXiv:2405.14224},
year = {2024}
}
备注
The code of our work is available here: {\url{https://github.com/tyshiwo1/DiM-DiffusionMamba/}}