SimFlow:潜在归一化流的简化端到端训练
计算机视觉与模式识别
2025-12-04 v1
摘要
归一化流(NFs)学习数据与高斯分布之间的可逆映射。先前的工作通常受两个局限。首先,它们向训练样本或VAE潜在变量添加随机噪声作为数据增强,引入了包括额外加噪和去噪步骤的复杂流程。其次,它们使用预训练且冻结的VAE编码器,导致重建和生成质量次优。在本文中,我们发现这两个问题可以用一种非常简单的方式解决:只需将方差(否则将由VAE编码器预测)固定为常数(例如0.5)。一方面,该方法允许编码器输出更广泛的token分布,解码器学习从增强的token分布中重建干净图像,避免了额外的噪声或去噪设计。另一方面,固定方差简化了VAE的证据下界,使其能够稳定地联合训练NF和VAE。在ImageNet 生成任务上,我们的模型SimFlow获得了2.15的gFID分数,优于最先进的方法STARFlow(gFID 2.40)。此外,SimFlow可以无缝集成端到端表示对齐(REPA-E)方法,并实现了1.91的改进gFID,在NFs中树立了新的最先进水平。
引用
@article{arxiv.2512.04084,
title = {SimFlow: Simplified and End-to-End Training of Latent Normalizing Flows},
author = {Qinyu Zhao and Guangting Zheng and Tao Yang and Rui Zhu and Xingjian Leng and Stephen Gould and Liang Zheng},
journal= {arXiv preprint arXiv:2512.04084},
year = {2025}
}
备注
Project Page: https://qinyu-allen-zhao.github.io/SimFlow/