中文

NativeTok:用于改进图像生成的本土视觉分词

计算机视觉与模式识别 2026-02-02 v1

摘要

基于向量量化(VQ)的图像生成通常遵循两个阶段的管道:分词器将图像编码为离散标记,生成模型学习其依赖关系以进行重建。然而,第一阶段的改进分词并不一定增强第二阶段的生成,因为现有方法无法约束标记之间的依赖关系。这种不匹配迫使生成模型从无序分布中学习,导致偏差和关联性较弱。为此,我们提出本土视觉分词,以在分词期间强制因果依赖关系。基于这一思想,我们引入 NativeTok 框架,在嵌入标记序列中的关系约束的同时实现高效重建。NativeTok 包括:(1) 用于潜在图像建模的 Meta Image Transformer(MIT),以及 (2) Mixture of Causal Expert Transformer(MoCET),其中每个轻量级专家块条件于先前标记和潜在特征生成单个标记。我们进一步设计了分层本土训练策略,只更新新的专家块,以确保训练效率。大量实验表明,NativeTok 的有效性。

关键词

引用

@article{arxiv.2601.22837,
  title  = {NativeTok: Native Visual Tokenization for Improved Image Generation},
  author = {Bin Wu and Mengqi Huang and Weinan Jia and Zhendong Mao},
  journal= {arXiv preprint arXiv:2601.22837},
  year   = {2026}
}