WeTok:面向高保真视觉重建的强大离散分词器
计算机视觉与模式识别
2026-02-10 v3
摘要
视觉分词器是视觉生成的关键组件。然而,现有的分词器常常在压缩比率与重构保真度之间面临令人不满的权衡。为填补这一空白,我们介绍一种强大且简洁的 WeTok 分词器,通过两个核心创新性手段超越了前所未有的领先分词器。(1)组间无查找量化(GQ)。我们将潜在特征划分为组,并对每一组执行无查找量化。因此,GQ 能够高效地克服先前分词器的内存和计算限制,同时通过更可扩展的词汇表实现重构突破。(2)生成式解码器(GD)。不同于先前的分词器,我们引入一个带有额外噪声变量先验的生成式解码器。在这种情况下,GD 能够对给定离散标记条件下的视觉数据分布进行概率建模,使 WeTok 能够在高压缩比率下重构视觉细节。在 ImageNet 50k 验证集上,以高保真度设置,WeTok 实现了纪录般的零样本 rFID 为 0.12,超越了领先的连续分词器如 FLUX-VAE(0.18)和 SD-VAE 3.5(0.19),压缩比率为 400%。此外,在高压缩 regime 下,WeTok 以 768× 压缩比率实现了零样本 rFID 为 3.49,显著超越了 Cosmos,其仅以我们压缩比率的 50% 获得 4.57 的分数。代码和模型均可访问:https://github.com/zhuangshaobin/WeTok。
引用
@article{arxiv.2508.05599,
title = {WeTok: Powerful Discrete Tokenization for High-Fidelity Visual Reconstruction},
author = {Shaobin Zhuang and Yiwei Guo and Canmiao Fu and Zhipeng Huang and Zeyue Tian and Xiaohui Li and Fangyikang Wang and Ying Zhang and Chen Li and Yali Wang},
journal= {arXiv preprint arXiv:2508.05599},
year = {2026}
}
备注
32 pages, 15 figures, 39 tables