中文

Meissonic:用于高分辨率文本到图像合成的高效掩码生成变换器

计算机视觉与模式识别 2025-03-14 v4

摘要

我们提出 Meissonic,将非自回归掩码图像建模(MIM)文本到图像提升至与最先进扩散模型如 SDXL 相当的水平。通过融入一整套架构创新、先进的位置编码策略和优化后的采样条件,Meissonic 大幅提升了 MIM 的性能和效率。此外,我们利用高质量训练数据,集成以人类偏好得分信息驱动的微观条件,并采用特征压缩层进一步增强图像保真度和分辨率。我们的模型不仅匹配,甚至常常超过了现有模型如 SDXL 在生成高质量高分辨率图像方面的表现。广泛的实验验证了 Meissonic 的能力,展示了其作为文本到图像合成新标准的潜力。我们发布了一个能够生成 1024×10241024 \times 1024 分辨率图像的模型检查点。

关键词

引用

@article{arxiv.2410.08261,
  title  = {Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis},
  author = {Jinbin Bai and Tian Ye and Wei Chow and Enxin Song and Xiangtai Li and Zhen Dong and Lei Zhu and Shuicheng Yan},
  journal= {arXiv preprint arXiv:2410.08261},
  year   = {2025}
}

备注

Accepted to ICLR 2025. Codes and Supplementary Material: https://github.com/viiika/Meissonic