中文

Qwen-Image-VAE-2.0技术报告

计算机视觉与模式识别 2026-05-14 v1

摘要

我们 presented Qwen-Image-VAE-2.0,这是一套高压缩率变分自编码器(VAEs),在重建保真度和diffusability方面取得了显著进展。为解决高压缩率重建瓶颈,我们采用改进的架构,包括全局跳过连接(GSC)和扩充潜在通道。此外,我们将训练规模扩展到数十亿图像,并纳入合成渲染引擎以提高文本丰富场景中的性能。为解决高维潜在空间的收敛挑战,我们实施了增强的语义对齐策略,使潜在空间高度适合扩散建模。为优化计算效率,我们利用非对称且无注意力的encoder-decoder主干结构来最小化编码开销。我们对Qwen-Image-VAE-2.0在公共重建基准测试中进行了全面评估。为评估文本丰富场景中的性能,我们提出了OmniDoc-TokenBench,一个新基准,包含多样化的真实文档并配备专门的OCR-based评估指标。Qwen-Image-VAE-2.0实现了最先进的重建性能,在一般领域和文本丰富场景中都表现出卓越的高压缩比能力。此外,下游DiT实验显示我们的模型具有优异的diffusability,显著加快了与现有高压缩基线的收敛速度。这建立了Qwen-Image-VAE-2.0作为具有高压缩比、卓越重建和出色diffusability的领先模型。

关键词

引用

@article{arxiv.2605.13565,
  title  = {Qwen-Image-VAE-2.0 Technical Report},
  author = {Zekai Zhang and Deqing Li and Kuan Cao and Yujia Wu and Chenfei Wu and Yu Wu and Liang Peng and Hao Meng and Jiahao Li and Jie Zhang and Kaiyuan Gao and Kun Yan and Lihan Jiang and Ningyuan Tang and Shengming Yin and Tianhe Wu and Xiao Xu and Xiaoyue Chen and Yan Shu and Yanran Zhang and Yilei Chen and Yixian Xu and Yuxiang Chen and Zhendong Wang and Zihao Liu and Zikai Zhou and Yiliang Gu and Yi Wang and Xiaoxiao Xu and Lin Qu},
  journal= {arXiv preprint arXiv:2605.13565},
  year   = {2026}
}