中文

CAT:内容自适应图像分词

计算机视觉与模式识别 2025-01-07 v1

摘要

现有的大多数图像分词器将图像编码为固定数量的 token 或 patch,忽略了图像复杂度的内在变化。为此,我们引入了内容自适应分词器(CAT),它根据图像内容动态调整表示容量,并将较简单的图像编码为更少的 token。我们设计了一个基于描述(caption)的评估系统,利用大语言模型(LLMs)来预测内容复杂度,并为给定图像确定最佳压缩比,同时考虑对人类感知至关重要的因素。CAT 在具有多样化压缩比的图像上进行训练,在图像重建中表现出强大的性能。我们还利用其可变长度的潜在表示来训练用于 ImageNet 生成的 Diffusion Transformers (DiTs)。通过优化 token 分配,CAT 在相同 FLOPs 下优于固定压缩比的基线方法,FID 分数有所提升,并将推理吞吐量提高了 18.5%。

关键词

引用

@article{arxiv.2501.03120,
  title  = {CAT: Content-Adaptive Image Tokenization},
  author = {Junhong Shen and Kushal Tirumala and Michihiro Yasunaga and Ishan Misra and Luke Zettlemoyer and Lili Yu and Chunting Zhou},
  journal= {arXiv preprint arXiv:2501.03120},
  year   = {2025}
}