可组合视觉标记化器及其可诊断可学习性
计算机视觉与模式识别
2026-02-04 v1
摘要
我们介绍CompTok,这是一个用于学习视觉标记化器的训练框架,其标记经过可组合性增强。CompTok采用标记条件扩散解码器。通过采用InfoGAN风格的目标,即训练一个识别模型来预测用于条件扩散解码器的标记所用的标记,使用解码后的图像来实现,从而强制解码器不忽略任何标记。为了促进可组合控制,除了原始图像外,CompTok还训练于在图像之间交换标记子集后形成的标记,使解码器对标记的可组合控制更加强大。由于交换后的标记之间没有 ground truth 图像目标,我们通过对抗流正则化施加流形约束,以保持未成对的换位生成在自然图像分布上。在结果标记化器不仅在图像类别条件生成方面实现了最新性能,而且还表现出如在图像之间交换标记以实现图像高层语义编辑的属性。此外,我们提出了两种度量标准,用于描述标记空间的landscape,这些度量标准不仅可以描述标记的可组合性,还可以描述该landscape对于生成器在此空间上训练的易学性。我们在实验中显示,CompTok在两项度量标准上均取得了改进,同时支持最新的用于类别条件生成的生成器。
引用
@article{arxiv.2602.03339,
title = {Composable Visual Tokenizers with Generator-Free Diagnostics of Learnability},
author = {Bingchen Zhao and Qiushan Guo and Ye Wang and Yixuan Huang and Zhonghua Zhai and Yu Tian},
journal= {arXiv preprint arXiv:2602.03339},
year = {2026}
}