中文

REGLUE:通过全局与局部语义粘合潜变量以实现纠缠扩散

计算机视觉与模式识别 2025-12-19 v1

摘要

潜变量扩散模型(LDMs)实现了最先进的图像合成,但其重建式去噪目标仅提供间接的语义监督:高层语义缓慢涌现,需要更长的训练时间并限制了样本质量。近期工作通过表示对齐从视觉基础模型(VFMs)外部注入语义,或通过在扩散过程中仅联合建模 VFM 特征的狭窄切片来内部注入语义,未能充分利用丰富的、非线性的、多层空间语义。我们引入 REGLUE(具有全局-局部统一编码的表示纠缠),一个统一的潜变量扩散框架,在单个 SiT 主干中联合建模(i)VAE 图像潜变量,(ii)紧凑的局部(块级)VFM 语义,以及(iii)全局的(图像级) 标记。一个轻量级的卷积语义压缩器非线性地聚合多层 VFM 特征,生成低维的、空间结构化的表示,该表示在扩散过程中与 VAE 潜变量纠缠。外部对齐损失进一步将内部表示正则化至冻结的 VFM 目标。在 ImageNet 256×256 上,REGLUE 一致地改进了 FID 并加速了收敛,优于 SiT-B/2 和 SiT-XL/2 基线,以及 REPA、ReDi 和 REG。广泛的实验表明,(a)空间 VFM 语义至关重要,(b)非线性压缩是释放其全部优势的关键,(c)全局标记和外部对齐在我们全局-局部-潜变量联合建模框架中充当互补的轻量级增强。代码可在 https://github.com/giorgospets/reglue 获取。

关键词

引用

@article{arxiv.2512.16636,
  title  = {REGLUE Your Latents with Global and Local Semantics for Entangled Diffusion},
  author = {Giorgos Petsangourakis and Christos Sgouropoulos and Bill Psomas and Theodoros Giannakopoulos and Giorgos Sfikas and Ioannis Kakogeorgiou},
  journal= {arXiv preprint arXiv:2512.16636},
  year   = {2025}
}