MixFlow训练:通过减缓插值混合缓解暴露偏差
计算机视觉与模式识别
2025-12-23 v1 人工智能
摘要
本文研究训练-测试差异(即暴露偏差)问题以改进扩散模型。在训练过程中,预测网络在一个训练时间步的输入是对应的真实噪声数据,该数据是噪声和数据的插值;而在测试过程中,输入是生成的噪声数据。我们提出了一种新颖的训练方法,名为MixFlow,用于提升性能。我们的方法受到慢流现象的启发:在给定采样时间步,与生成的噪声数据最接近的真实插值被观察到对应于一个更高噪声的时间步(称为减缓时间步),即对应的真实时间步比采样时间步更慢。MixFlow利用减缓时间步的插值(称为减缓插值混合)对每个训练时间步的预测网络进行后训练。在类别条件图像生成(包括SiT、REPA和RAE)以及文本到图像生成上的实验验证了我们方法的有效性。我们的方法MixFlow在RAE模型上于ImageNet取得了强大的生成结果:在256×256分辨率下FID为1.43(无引导)和1.10(有引导),在512×512分辨率下FID为1.55(无引导)和1.10(有引导)。
引用
@article{arxiv.2512.19311,
title = {MixFlow Training: Alleviating Exposure Bias with Slowed Interpolation Mixture},
author = {Hui Li and Jiayue Lyu and Fu-Yun Wang and Kaihui Cheng and Siyu Zhu and Jingdong Wang},
journal= {arXiv preprint arXiv:2512.19311},
year = {2025}
}