LSSGen:在流匹配与扩散模型中利用潜在空间缩放以实现高效文本到图像生成
计算机视觉与模式识别
2025-07-23 v1 人工智能
摘要
流匹配和扩散模型在文本到图像生成方面展现出了令人瞩目的成果,通过迭代去噪过程生成逼真的图像。加速合成的一种常见策略是在较低分辨率下进行早期去噪。然而,在像素空间中下采样和上采样的传统方法通常会引入伪影和失真。当上采样后的图像被重新编码到潜在空间时,会出现这些问题,导致最终图像质量下降。为了解决这个问题,我们提出了 {\bf 潜在空间缩放生成(LSSGen)},这是一个使用轻量级潜在上采样器直接在潜在空间中执行分辨率缩放的框架。在不改变 Transformer 或 U-Net 架构的情况下,LSSGen 提高了效率和视觉质量,同时支持灵活的多分辨率生成。我们涵盖文本-图像对齐和感知质量的综合评估表明,LSSGen 显著优于传统的缩放方法。在相似速度下生成 图像时,它实现了高达 246\% 的 TOPIQ 分数提升。
引用
@article{arxiv.2507.16154,
title = {LSSGen: Leveraging Latent Space Scaling in Flow and Diffusion for Efficient Text to Image Generation},
author = {Jyun-Ze Tang and Chih-Fan Hsu and Jeng-Lin Li and Ming-Ching Chang and Wei-Chao Chen},
journal= {arXiv preprint arXiv:2507.16154},
year = {2025}
}
备注
ICCV AIGENS 2025