DC-AR:基于深度压缩混合分词器的高效掩码自回归图像生成
计算机视觉与模式识别
2025-07-08 v1 人工智能
摘要
我们介绍了 DC-AR,一种新颖的掩码自回归(AR)文本到图像生成框架,它以卓越的计算效率提供了优越的图像生成质量。由于分词器的局限性,先前的掩码 AR 模型在质量或效率上落后于扩散模型。我们通过引入 DC-HT(一种用于 AR 模型的深度压缩混合分词器)克服了这一限制,该分词器实现了 32 倍的空间压缩比,同时保持了高重建保真度和跨分辨率泛化能力。基于 DC-HT,我们扩展了 MaskGIT,并创建了一个新的混合掩码自回归图像生成框架,该框架首先通过离散标记生成结构元素,然后通过残差标记进行细化。DC-AR 在 MJHQ-30K 上取得了 5.49 的 gFID 和 GenEval 上 0.69 的总分的最先进结果,同时与先前领先的扩散和自回归模型相比,提供了 1.5-7.9 倍的更高吞吐量和 2.0-3.5 倍的更低延迟。
引用
@article{arxiv.2507.04947,
title = {DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer},
author = {Yecheng Wu and Junyu Chen and Zhuoyang Zhang and Enze Xie and Jincheng Yu and Junsong Chen and Jinyi Hu and Yao Lu and Song Han and Han Cai},
journal= {arXiv preprint arXiv:2507.04947},
year = {2025}
}
备注
ICCV 2025