非对称流模型
计算机视觉与模式识别
2026-05-26 v2
摘要
在高维空间中进行流式生成较为困难,因为速度预测需要建模高维噪声,即使数据具有强大的低秩结构。我们提出了非对称流模型(AsymFlow),这是一种秩非对称的速度参数化方法,将噪声预测限制在低秩子空间中,同时保持数据预测的全维。从这种非对称预测中,AsymFlow 在不改变网络架构或训练/采样程序的前提下,解析地恢复完整维度的速度。在 ImageNet 256×256 上,AsymFlow 实现了领先的 1.57 FID,显著优于先前的 DiT/JiT 类像素扩散模型。AsymFlow 还提供了将预训练潜在流模型微调到像素空间模型的首次可能路径:将低秩像素子空间对齐到潜在空间可提供无缝初始化,保留潜在模型的高层语义和结构,因此微调主要改进低层次的不匹配,而非重新学习像素生成。我们表明,基于 FLUX.2 klein 9B 微调的像素 AsymFlow 模型在 HPSv3、DPG-Bench 和 GenEval 上均建立了像素空间文本到图像生成的新型态,同时在定性上显示出显著改善的视觉真实性。
引用
@article{arxiv.2605.12964,
title = {Asymmetric Flow Models},
author = {Hansheng Chen and Jan Ackermann and Minseo Kim and Gordon Wetzstein and Leonidas Guibas},
journal= {arXiv preprint arXiv:2605.12964},
year = {2026}
}
备注
Code: https://github.com/Lakonik/LakonLab Webpage: https://hanshengchen.com/asymflow