中文

MANZANO:一种具有混合视觉分词器的简单可扩展统一多模态模型

计算机视觉与模式识别 2025-09-22 v1 计算与语言 机器学习

摘要

能够理解和生成视觉内容的统一多模态大语言模型 具有巨大潜力。然而,现有的开源模型在这些能力之间往往存在性能权衡。我们提出了 Manzano,一个简单且可扩展的统一框架,通过将混合图像分词器与精心策划的训练方案相结合,大幅缓解了这种矛盾。单个共享视觉编码器馈送两个轻量级适配器,它们在公共语义空间内为图像到文本理解生成连续嵌入,为文本到图像生成生成离散 token。统一的自回归 LLM 以文本和图像 token 的形式预测高级语义,随后辅助扩散解码器将图像 token 转换为像素。该架构结合在理解和生成数据上的统一训练方案,实现了两种能力的可扩展联合学习。Manzano 在统一模型中取得了 SOTA 结果,并与专家模型具有竞争力,特别是在富文本评估上。我们的研究表明任务冲突极小,且从扩大模型规模中获得一致的收益,验证了我们混合分词器的设计选择。

关键词

引用

@article{arxiv.2509.16197,
  title  = {MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer},
  author = {Yanghao Li and Rui Qian and Bowen Pan and Haotian Zhang and Haoshuo Huang and Bowen Zhang and Jialing Tong and Haoxuan You and Xianzhi Du and Zhe Gan and Hyunjik Kim and Chao Jia and Zhenbang Wang and Yinfei Yang and Mingfei Gao and Zi-Yi Dou and Wenze Hu and Chang Gao and Dongxu Li and Philipp Dufter and Zirui Wang and Guoli Yin and Zhengdong Zhang and Chen Chen and Yang Zhao and Ruoming Pang and Zhifeng Chen},
  journal= {arXiv preprint arXiv:2509.16197},
  year   = {2025}
}