UltraFlux: 面向高保真原生4K多宽高比文生图的数据-模型协同设计
计算机视觉与模式识别
2025-11-25 v1
摘要
扩散变压器最近在约1K分辨率下实现了强大的文生图能力,但我们表明,将其扩展到原生4K并覆盖多种宽高比时,会暴露出一个紧密耦合的故障模式,涉及位置编码、VAE压缩和优化。孤立地处理这些因素中的任何一个都会导致质量大幅下降。因此,我们采用数据-模型协同设计的视角,引入了UltraFlux,这是一个基于Flux的DiT,在MultiAspect-4K-1M上以原生4K分辨率训练。MultiAspect-4K-1M是一个包含100万张4K图像的语料库,具有受控的多宽高比覆盖、双语字幕以及丰富的VLM/IQA元数据,用于分辨率和宽高比感知的采样。在模型方面,UltraFlux结合了(i) 结合YaRN的Resonance 2D RoPE,用于4K下的训练窗口、频率和宽高比感知的位置编码;(ii) 一个简单的、非对抗性的VAE后训练方案,提高了4K重建保真度;(iii) 一个信噪比感知的Huber小波目标函数,用于重新平衡时间步和频带上的梯度;以及(iv) 一个分阶段的美学课程学习策略,该策略将高美学监督集中在由模型先验控制的高噪声步骤上。这些组件共同产生了一个稳定、细节保持的4K DiT,能够泛化到宽、方和高的宽高比。在4096分辨率的美学评估基准和多宽高比4K设置上,UltraFlux在保真度、美学和一致性指标上持续优于强大的开源基线,并且——配合LLM提示优化器——达到或超越了专有的Seedream 4.0。
引用
@article{arxiv.2511.18050,
title = {UltraFlux: Data-Model Co-Design for High-quality Native 4K Text-to-Image Generation across Diverse Aspect Ratios},
author = {Tian Ye and Song Fei and Lei Zhu},
journal= {arXiv preprint arXiv:2511.18050},
year = {2025}
}
备注
Project Page: https://w2genai-lab.github.io/UltraFlux/