中文

HieraTok:多尺度视觉标记器提升图像重建与生成

计算机视觉与模式识别 2025-09-30 v1 人工智能

摘要

本工作提出HieraTok,一种新型基于多尺度视觉Transformer(ViT)的标记器,克服了单尺度表示建模的固有局限。这一设计通过两关键方式实现:(1)对标记器编码器生成的标记图应用多尺度下采样,产生一系列多尺度标记;(2)引入尺度因果注意力机制,使信息能够从低分辨率全局语义特征逐步流向高分辨率结构细节。将上述设计组合起来,HieraTok在图像重建和生成任务中实现显著提升。在相同设置下,多尺度视觉标记器相较于单尺度标记器在rFID指标上提升27.2%,从1.47提升至1.07。当集成到下游生成框架中时,实现收敛速度提升1.38×1.38\times,gFID提升18.9%,从16.4提升至13.3,这可能归因于更平滑且分布更均匀的潜在空间。此外,通过扩大标记器训练规模,我们以最新的rFID为0.45和gFID为1.82的成绩展示了其潜力。在我们所知的情况下,本文首次引入多尺度基于ViT的标记器用于图像重建和图像生成。我们希望我们的发现和设计推动基于ViT的标记器在视觉生成任务中的发展。

关键词

引用

@article{arxiv.2509.23736,
  title  = {HieraTok: Multi-Scale Visual Tokenizer Improves Image Reconstruction and Generation},
  author = {Cong Chen and Ziyuan Huang and Cheng Zou and Muzhi Zhu and Kaixiang Ji and Jiajia Liu and Jingdong Chen and Hao Chen and Chunhua Shen},
  journal= {arXiv preprint arXiv:2509.23736},
  year   = {2025}
}