中文

图像分词器需要后训练

计算机视觉与模式识别 2025-09-17 v1

摘要

近期的图像生成模型通常依赖冻结的图像分词器,在预先构建的潜在空间中捕捉图像分布。然而,在重建分布与生成分布之间存在显著差异,当前的分词器仅优先考虑生成训练之前发生的重建任务,而未考虑采样过程中的生成误差。在本文中,我们全面分析了离散潜在空间中产生这种差异的原因,并据此提出了一种新颖的分词器训练方案,包含主训练和后训练,分别侧重于改进潜在空间构建和解码。在主训练期间,提出了一种潜在扰动策略来模拟采样噪声,即在生成推理中产生的意外 token。具体而言,我们提出了一种即插即用的分词器训练方案,显著增强了分词器的鲁棒性,从而提升了生成质量和收敛速度;同时提出了一种新颖的分词器评估指标,即 pFID,成功将分词器性能与生成质量相关联。在后训练期间,我们针对训练良好的生成模型进一步优化分词器解码器,以缓解生成 token 与重建 token 之间的分布差异。使用约 400M 参数的生成器,采用我们提出的主训练方案训练的离散分词器达到了显著的 1.60 gFID,并在额外的后训练后进一步获得了 1.36 gFID。进一步的实验广泛验证了我们的后训练策略在现成的离散和连续分词器上的有效性,这些分词器与自回归和基于扩散的生成器相结合。

关键词

引用

@article{arxiv.2509.12474,
  title  = {Image Tokenizer Needs Post-Training},
  author = {Kai Qiu and Xiang Li and Hao Chen and Jason Kuen and Xiaohao Xu and Jiuxiang Gu and Yinyi Luo and Bhiksha Raj and Zhe Lin and Marios Savvides},
  journal= {arXiv preprint arXiv:2509.12474},
  year   = {2025}
}

备注

21 pages, 16 figures, 10 tables. arXiv admin note: substantial text overlap with arXiv:2503.08354