中文

图像理解成就图像生成的好分词器

计算机视觉与模式识别 2024-11-08 v1

摘要

摘要 现代图像生成(IG)模型已被证明能够捕捉对图像理解(IU)任务有价值的丰富语义。然而,IU模型提升IG性能的潜力仍未被探索。我们通过基于分词的IG框架来解决此问题,该框架依赖于有效的分词器将图像投影为分词序列。目前,像素重建(例如VQGAN)主导了图像分词器的训练目标。相比之下,我们的方法采用特征重建目标,其中分词器通过从预训练的IU编码器蒸馏知识进行训练。全面的比较表明,具有强大IU能力的分词器在各种指标、数据集、任务和提议网络上实现了优越的IG性能。值得注意的是,VQ-KD CLIP在ImageNet-1k (IN-1k)上达到了4.104.10 FID。可视化表明VQ-KD的优越性部分归因于VQ-KD码本中的丰富语义。我们进一步引入了一个直接的流水线,将IU编码器直接转换为分词器,在IG任务中展示了显著的有效性。这些发现可能激发对图像分词器研究的进一步探索,并激励社区重新评估IU与IG之间的关系。代码发布于 https://github.com/magic-research/vector_quantization.

关键词

引用

@article{arxiv.2411.04406,
  title  = {Image Understanding Makes for A Good Tokenizer for Image Generation},
  author = {Luting Wang and Yang Zhao and Zijian Zhang and Jiashi Feng and Si Liu and Bingyi Kang},
  journal= {arXiv preprint arXiv:2411.04406},
  year   = {2024}
}

备注

Accepted by NeurIPS 2024