D2C:通过离散标记解锁连续自回归图像生成的潜力
计算机视觉与模式识别
2025-03-24 v1
摘要
在图像生成领域,基于潜在的生成模型占据主导地位;然而,这些模型严重依赖图像 tokenizer。为满足建模要求,自回归模型拥有可扩展性和灵活性的特征,拥抱离散值 tokenizer,但面临图像生成质量差的问题。相比之下,扩散模型利用连续值 tokenizer 实现更好的生成质量,但受制于低效率和复杂性。现有的混合模型主要是为了弥补信息损失并简化扩散学习过程。将离散值和连续值标记在图像生成领域的潜力尚未被探索。在本文中,我们提出了 D2C,一种新型两阶段方法来增强模型的生成能力。在第一阶段,采用小型离散值生成器对表示粗粒度图像特征的离散值标记进行采样。随后在第二阶段,在离散标记序列的条件下学习表示细粒度图像特征的连续值标记。此外,我们设计了两种融合模块以实现无缝交互。在 ImageNet-256 基准上,广泛的实验结果验证了我们的模型在类别条件图像生成任务方面优于几种连续值和离散值生成模型。
引用
@article{arxiv.2503.17155,
title = {D2C: Unlocking the Potential of Continuous Autoregressive Image Generation with Discrete Tokens},
author = {Panpan Wang and Liqiang Niu and Fandong Meng and Jinan Xu and Yufeng Chen and Jie Zhou},
journal= {arXiv preprint arXiv:2503.17155},
year = {2025}
}