中文

Hita:用于自回归图像生成的全面化分词器

计算机视觉与模式识别 2025-07-14 v4 人工智能

摘要

传统自回归图像生成模型逐步生成视觉标记,限制了其捕获标记序列中整体关系的能力。此外,由于大多数视觉标记器将局部图像块映射到潜在标记,全局信息有限。为此, 本文引入了 \textit{Hita}, 一种用于自回归(AR)图像生成的新型图像标记器。它引入了以可学习的整体查询和局部块标记为主的整体到局部标记方案。Hita 包含两种关键策略以更好地适应 AR 生成过程: 1) {安排} 具有整体标记的序列结构, 随后是块级标记, 并使用因果注意力保持对前一个标记的 awareness; 2) 采用轻量级融合模块, 在将去量化标记输入解码器之前控制信息流并优先处理整体标记。广泛的实验表明, Hita 加快了 AR 生成器的训练速度, 并优于使用常规标记器训练的模型, 在 ImageNet 数据集上实现 \textbf{2.59 FID} 和 \textbf{281.9 IS}。详细的整体表示分析突显了其捕获全局图像属性(如纹理、材料和形状)的能力。此外, Hita 也在零样本风格迁移和图像填充中显示出有效性。代码可在 \href{https://github.com/CVMI-Lab/Hita}{https://github.com/CVMI-Lab/Hita} 获取。

关键词

引用

@article{arxiv.2507.02358,
  title  = {Hita: Holistic Tokenizer for Autoregressive Image Generation},
  author = {Anlin Zheng and Haochen Wang and Yucheng Zhao and Weipeng Deng and Tiancai Wang and Xiangyu Zhang and Xiaojuan Qi},
  journal= {arXiv preprint arXiv:2507.02358},
  year   = {2025}
}

备注

17 pages, 10 figures