中文

Instella-T2I:推动 1D 离散潜在空间图像生成的极限

计算机视觉与模式识别 2025-06-27 v1

摘要

图像分词在降低高分辨率图像建模的计算需求方面发挥着关键作用,显著提高了图像和多模态理解与生成的效率。最近的 1D 潜在空间的进展通过消除对 2D 网格结构的需求,大幅降低了所需标记的数量。本文进一步推进紧凑的离散图像表示,引入 1D 二进制图像潜在空间。通过将每个图像表示为二进制向量序列,而非使用传统的 one-hot 码本标记,我们的方法在保持 1D 潜在空间紧凑性的同时,保留了高分辨率细节。到目前为止,我们的文本到图像模型是首次在仅使用 128 个离散标记即可实现从 diffusion 和自回归生成中具竞争力的性能,显示在 1024x1024 分辨率的图像上,标记数量相较于标准 VQ-VAE 降低了最高可达 32 倍。该提议的 1D 二进制潜在空间,结合简单模型架构,显著提高了训练和推理速度。我们的文本到图像模型可以在单个 GPU 节点上使用 8 个 AMD MI300X GPU 的全局 batch size 为 4096,训练时间可在 200 个 GPU 天内完成。我们的模型在没有任何内部私人训练数据或后训练细化的情况下,以与现代图像生成模型相当的性能实现了竞争力,提供了一种可扩展且高效的替代方案,以应对传统分词方法的需求。

关键词

引用

@article{arxiv.2506.21022,
  title  = {Instella-T2I: Pushing the Limits of 1D Discrete Latent Space Image Generation},
  author = {Ze Wang and Hao Chen and Benran Hu and Jiang Liu and Ximeng Sun and Jialian Wu and Yusheng Su and Xiaodong Yu and Emad Barsoum and Zicheng Liu},
  journal= {arXiv preprint arXiv:2506.21022},
  year   = {2025}
}