中文

语言引导的图像标记化用于生成

计算机视觉与模式识别 2025-04-08 v2 人工智能 机器学习

摘要

图像标记化,即将原始图像像素转换为紧凑的低维潜在表示,已被证明对可扩展和高效的图像生成至关重要。然而,主流图像标记化方法通常压缩率有限,使得高分辨率图像生成的计算成本高昂。为应对这一挑战,我们提出利用语言进行高效图像标记化,并将其命名为 Text-Conditioned Image Tokenization(TexTok)。TexTok 是一个简单而有效的标记化框架,利用语言提供紧凑的高层语义表示。通过将标记化过程建立在描述性文本标题之上,TexTok 简化了语义学习,使更多的学习能力和标记空间得以分配以捕捉细粒度的视觉细节,从而实现增强的重构质量和更高的压缩率。与无文本条件化的传统标记化器相比,TexTok 在 ImageNet-256 和 -512 基准测试上分别实现了平均重构 FID 提升 29.2% 和 48.1%(在不同标记数量下)。这些标记化改进一致地转化为生成 FID 平均提升 16.3% 和 34.3%。仅通过将 Diffusion Transformer(DiT)中的标记化器替换为 TexTok,我们的系统即可实现 93.5 倍推理加速,同时在仅使用 32 个标记于 ImageNet-512 时仍优于原始 DiT。TexTok 搭配 vanilla DiT 生成器在 ImageNet-256 和 -512 上分别取得了 1.46 和 1.62 的 SOTA FID 分数。此外,我们展示了 TexTok 在文本到图像生成任务上的优越性,有效利用现成的文本标题进行标记化。项目页面位于:https://kaiwenzha.github.io/textok/。

关键词

引用

@article{arxiv.2412.05796,
  title  = {Language-Guided Image Tokenization for Generation},
  author = {Kaiwen Zha and Lijun Yu and Alireza Fathi and David A. Ross and Cordelia Schmid and Dina Katabi and Xiuye Gu},
  journal= {arXiv preprint arXiv:2412.05796},
  year   = {2025}
}

备注

CVPR 2025 Oral. Project page: https://kaiwenzha.github.io/textok/