中文

SemHiTok:基于语义引导分层码本的统一图像 Tokenizer,面向多模态理解与生成

计算机视觉与模式识别 2026-03-03 v5 人工智能

摘要

在本文中,我们介绍了 SemHiTok,一种基于语义引导分层码本的统一图像 Tokenizer,为多模态理解和生成提供一致的离散表示。最近,统一图像 tokenizer 引发了研究界的探索,其旨在捕获用于理解的高级语义特征并保留用于生成的低级像素特征。先前的工作试图通过结合语义蒸馏和像素重建的损失来训练统一图像 tokenizer。然而,由于多模态理解和生成优先考虑的特征层级不同,联合训练方法在实现良好权衡方面面临重大挑战。SemHiTok 通过一种新颖的语义引导分层码本解决了这一挑战,该码本在预训练的语义码本上构建像素子码本。这种设计在结构和训练策略上解耦了语义和像素,使 tokenizer 能够在捕获像素特征的同时保留其理解高级语义信息的能力。我们的实验表明,在 LLaVA-v1.5 设置下,SemHiTok 在图像重建和多模态理解中取得了领先的性能。此外,我们利用 SemHiTok 开发了一个统一的 MLLM,它在多模态理解和生成任务中表现出卓越的性能。大量实验证实了我们的分析,表明我们的统一图像 tokenizer 架构实现了更好的权衡。

关键词

引用

@article{arxiv.2503.06764,
  title  = {SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation},
  author = {Zisheng Chen and Chunwei Wang and Runhui Huang and Hongbin Xu and Xiuwei Chen and Jun Zhou and Jianhua Han and Hang Xu and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2503.06764},
  year   = {2026}
}

备注

ICLR 2026