2D高斯数遇见视觉标记化器
计算机视觉与模式识别
2025-08-21 v2
摘要
图像标记化器是AR图像生成中的关键组件,决定了如何将丰富且结构化的视觉内容编码为紧凑表示。现有基于量化的标记化器如VQ-GAN主要关注纹理和颜色等外观特征,由于基于图像块的设计,往往忽视几何结构。在本 work中,我们探索了如何将更多视觉信息纳入标记化器,提出了一种新框架Visual Gaussian Quantization(VGQ),这是一种新颖的标记化器范式,通过将2D高斯数集成到传统视觉码本量化框架中,显式增强结构建模。我们的做法解决了naive量化方法(如VQ-GAN)在基于图像块的设计和强调纹理与颜色方面难以建模结构化视觉信息的固有局限。相比之下,VGQ将图像潜在表示编码为2D高斯分布,有效捕捉几何和空间结构,通过直接建模位置、旋转和比例等结构相关参数。我们进一步证明,增加标记中2D高斯数的密度可显著提升重建保真度,提供了在标记效率与视觉丰富性之间的灵活权衡。在ImageNet 256x256基准上,VGQ以rFID得分1.00的强劲重建质量表现。此外,通过增加标记中2D高斯数的密度,VGQ在重建能力上实现显著提升,达到最先进的重建rFID得分0.556和PSNR 24.93,显著优于现有方法。代码将很快发布。
引用
@article{arxiv.2508.13515,
title = {2D Gaussians Meet Visual Tokenizer},
author = {Yiang Shi and Xiaoyang Guo and Wei Yin and Mingkai Jia and Qian Zhang and Xiaolin Hu and Wenyu Liu and Xinggang Wang},
journal= {arXiv preprint arXiv:2508.13515},
year = {2025}
}