GPSToken:面向图像表示与生成的高斯参数化空间自适应分词
计算机视觉与模式识别
2025-09-22 v2
摘要
有效且高效的分词在图像表示与生成中扮演着重要角色。传统方法受限于统一的 2D/1D 网格分词,无法灵活表示具有不同形状、纹理和位置的区域,限制了其征表示的有效性。在这项工作中,我们提出了 GPSToken,一种新颖的高斯参数化空间自适应分词框架,通过利用参数化 2D 高斯函数动态建模不同图像区域的形状、位置和纹理,实现非均匀的图像分词。我们首先采用熵驱动算法将图像分割成大小可变的纹理同质区域。然后,我们将每个区域参数化为一个 2D 高斯(均值表示位置,协方差表示形状)并耦合纹理特征。训练一个专门的 Transformer 来优化高斯参数,实现位置/形状的连续适应和内容感知的特征提取。在解码过程中,高斯参数化的 Token 通过一个可微的基于 Splatting 的渲染器重建为 2D 特征图,从而将我们的自适应分词与标准解码器连接起来进行端到端训练。GPSToken 将空间布局(高斯参数)与纹理特征解耦,以实现高效的两阶段生成:使用轻量级网络进行结构布局合成,然后进行结构条件化的纹理生成。实验证明了 GPSToken 的最先进性能,在使用 128 个 Token 的图像重建和生成任务上,分别取得了 0.65 和 1.50 的 rFID 和 FID 分数。GPSToken 的代码和模型可在 https://github.com/xtudbxk/GPSToken 找到。
引用
@article{arxiv.2509.01109,
title = {GPSToken: Gaussian Parameterized Spatially-adaptive Tokenization for Image Representation and Generation},
author = {Zhengqiang Zhang and Rongyuan Wu and Lingchen Sun and Lei Zhang},
journal= {arXiv preprint arXiv:2509.01109},
year = {2025}
}
备注
Accepted by NIPS 2025