中文

语义先行:通过异步潜在扩散统一语义与纹理建模

计算机视觉与模式识别 2025-12-08 v2

摘要

潜在扩散模型(LDM)本质上遵循由粗到细的生成过程,其中高层语义结构略早于细粒度纹理生成。这表明前驱语义可通过提供语义锚点来使纹理生成受益。近期进展已将预训练视觉编码器的语义先验集成以进一步增强LDM,但它们仍同步去噪语义和VAE编码的纹理,忽略了这种排序。观察到这一点,我们提出了语义优先扩散(SFD),一种明确优先语义形成的潜在扩散范式。SFD首先通过将来自预训练视觉编码器的紧凑语义潜在(经由专用语义VAE提取)与纹理潜在结合来构建复合潜在。SFD的核心是使用独立噪声调度异步去噪语义与纹理潜在:语义在时间上先于纹理,为纹理细化提供更清晰的高层指导,并实现自然的由粗到细生成。在ImageNet 256x256上带引导条件下,SFD达到FID 1.06(LightningDiT-XL)和FID 1.04(1.0B LightningDiT-XXL),同时收敛速度比原始DiT快100倍。SFD还改进了ReDi和VA-VAE等现有方法,证明了异步语义主导建模的有效性。项目页面与代码:https://yuemingpan.github.io/SFD.github.io/。

关键词

引用

@article{arxiv.2512.04926,
  title  = {Semantics Lead the Way: Harmonizing Semantic and Texture Modeling with Asynchronous Latent Diffusion},
  author = {Yueming Pan and Ruoyu Feng and Qi Dai and Yuqi Wang and Wenfeng Lin and Mingyu Guo and Chong Luo and Nanning Zheng},
  journal= {arXiv preprint arXiv:2512.04926},
  year   = {2025}
}