端到端训练的统一分词与潜在去噪
计算机视觉与模式识别
2026-03-24 v1 人工智能
图形学
机器学习
摘要
潜在扩散模型 (LDMs) 通过在学习到的潜在空间中操作实现高保真合成。然而,训练最先进的LDMs需要复杂的分阶段流程:必须先训练标记化器,之后才能在冻结的潜在空间中训练扩散模型。我们提出UNITE - 一种用于统一分词和潜在扩散的自编码器架构。UNITE由一个Generative Encoder构成,其既可作为图像标记化器,也可作为潜在生成器通过权重共享。我们的关键洞察是,标记化和生成可以视为在不同条件下进行的同一潜在推断问题:标记化从完全观察到的图像中推断潜在变量,而生成则从噪声以及文本或类别条件中推断。基于此,我们引入单阶段训练程序,通过同一Generative Encoder的两个前向传播同时优化两个任务。共享参数使梯度能够共同塑造潜在空间,鼓励形成一种“通用潜在语言”。在图像和分子模态上,UNITE在不使用对抗损失或预训练编码器(如DINO)的情况下实现接近最先进的性能,在ImageNet 256 x 256上,Base和Large模型分别达到FID 2.12和1.73。我们进一步通过表示对齐和压缩的视角分析了Generative Encoder。这些结果表明,从头开始对标记化与生成进行单阶段联合训练是可行的。
引用
@article{arxiv.2603.22283,
title = {End-to-End Training for Unified Tokenization and Latent Denoising},
author = {Shivam Duggal and Xingjian Bai and Zongze Wu and Richard Zhang and Eli Shechtman and Antonio Torralba and Phillip Isola and William T. Freeman},
journal= {arXiv preprint arXiv:2603.22283},
year = {2026}
}
备注
First two authors contributed equally. Project: https://xingjianbai.com/unite-tokenization-generation/ Code: https://github.com/ShivamDuggal4/UNITE-tokenization-generation