SRC-Flow:紧凑语义表示赋能归一化流用于图像生成
计算机视觉与模式识别
2026-05-26 v2
摘要
归一化流提供了精确似然和确定性可逆采样,但在大规模图像生成方面历来落后于扩散模型。我们指出了一个关键障碍:归一化流需要在整个环境空间上学习单一的可逆传输,使其对高维表示高度敏感。这导致现代视觉表示空间中出现语义容量不匹配,其中语义信息紧凑但编码在过完备特征中。我们提出 SRC-Flow,引入语义表示压缩器(SRC),在流建模之前将高维 RAE 特征压缩到低维语义空间,并通过冻结的 RAE 解码器保留重建能力。这一紧凑空间减轻了归一化流的建模负担,并在语义表示空间中实现了有效的基于似然的生成。我们进一步采用针对流学习的固定无条件双射量身定制的常数噪声正则化。在 ImageNet 和 上,SRC-Flow 在归一化流方法中实现了 SOTA 的生成质量,在无分类器引导下 gFID 得分分别为 1.65 和 2.07,同时在紧凑语义表示空间中保留了精确似然计算,并在流层面保留了确定性可逆采样。代码和模型将在 https://github.com/longtaojiang/SRC-Flow 提供。
引用
@article{arxiv.2605.18267,
title = {SRC-Flow: Compact Semantic Representations Enable Normalizing Flows for Image Generation},
author = {Longtao Jiang and Jianmin Bao and Zhendong Wang and Xin Tao and Pengfei Wan and Zhihui Li and Xiaojun Chang},
journal= {arXiv preprint arXiv:2605.18267},
year = {2026}
}