利用表示自编码器扩展文本到图像的扩散Transformer
计算机视觉与模式识别
2026-01-23 v1
摘要
表示自编码器(RAE)通过在ImageNet上训练高维语义潜在空间,在扩散建模中展现出显著优势。在本工作中,我们研究该框架能否扩展到大规模、自由形式的文本到图像(T2I)生成。我们首先在冻结的表示编码器(SigLIP-2)上,通过在网络数据、合成数据和文本渲染数据上训练,将RAE解码器扩展到ImageNet之外,发现虽然规模提升了整体保真度,但针对特定领域(如文本)的目标数据组成至关重要。然后,我们严格压力测试了最初为ImageNet提出的RAE设计选择。我们的分析揭示,扩展简化了框架:虽然维度相关的噪声调度仍然关键,但诸如宽扩散头和噪声增强解码等架构复杂性在扩展时带来的益处微乎其微。基于这个简化的框架,我们对RAE与最先进的FLUX VAE在0.5B到9.8B参数的扩散Transformer规模上进行了受控比较。在所有模型规模下,RAE在预训练期间始终优于VAE。此外,在高质量数据集上的微调过程中,基于VAE的模型在64个epoch后灾难性地过拟合,而RAE模型在256个epoch内保持稳定,并持续获得更好的性能。在所有实验中,基于RAE的扩散模型展现出更快的收敛速度和更好的生成质量,确立了RAE作为大规模T2I生成中比VAE更简单、更强的基础。此外,由于视觉理解和生成都可以在共享的表示空间中运行,多模态模型可以直接对生成的潜在表示进行推理,为统一模型开辟了新的可能性。
引用
@article{arxiv.2601.16208,
title = {Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders},
author = {Shengbang Tong and Boyang Zheng and Ziteng Wang and Bingda Tang and Nanye Ma and Ellis Brown and Jihan Yang and Rob Fergus and Yann LeCun and Saining Xie},
journal= {arXiv preprint arXiv:2601.16208},
year = {2026}
}
备注
website: https://rae-dit.github.io/scale-rae/