Meissonic:用于高分辨率文本到图像合成的高效掩码生成变换器
计算机视觉与模式识别
2025-03-14 v4
摘要
我们提出 Meissonic,将非自回归掩码图像建模(MIM)文本到图像提升至与最先进扩散模型如 SDXL 相当的水平。通过融入一整套架构创新、先进的位置编码策略和优化后的采样条件,Meissonic 大幅提升了 MIM 的性能和效率。此外,我们利用高质量训练数据,集成以人类偏好得分信息驱动的微观条件,并采用特征压缩层进一步增强图像保真度和分辨率。我们的模型不仅匹配,甚至常常超过了现有模型如 SDXL 在生成高质量高分辨率图像方面的表现。广泛的实验验证了 Meissonic 的能力,展示了其作为文本到图像合成新标准的潜力。我们发布了一个能够生成 分辨率图像的模型检查点。
引用
@article{arxiv.2410.08261,
title = {Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis},
author = {Jinbin Bai and Tian Ye and Wei Chow and Enxin Song and Xiangtai Li and Zhen Dong and Lei Zhu and Shuicheng Yan},
journal= {arXiv preprint arXiv:2410.08261},
year = {2025}
}
备注
Accepted to ICLR 2025. Codes and Supplementary Material: https://github.com/viiika/Meissonic