中文

Cheers: 解耦补丁细节与语义表示以实现统一的多模态理解与生成

计算机视觉与模式识别 2026-03-16 v1 人工智能

摘要

多模态建模的最新前沿主题之一是在单个模型中统一视觉理解与生成。然而,这两个任务需求不匹配的解码 regime和视觉表示,使得在共享特征空间中联合优化变得非平凡。本文提出了Cheers,一个通过解耦补丁级细节与语义表示来稳定语义、通过门控细节残差提升图像生成保真度的统一多模态模型。Cheers包含三个关键组件:(i)统一视觉token化器,将图像潜在状态编码并压缩为语义token,以实现高效的LLM条件化;(ii)基于LLM的Transformer,统一用于文本生成的自回归解码和图像生成的扩散解码;(iii)级联流匹配头部,先解码视觉语义,再从视觉token化器注入语义门控细节残差,以细化高频内容。在流行基准测试上的实验表明,Cheers在视觉理解与生成方面与先进的统一多模态模型相当或更好。Cheers还实现了4倍的token压缩,使高分辨率图像编码和生成更加高效。值得注意的是,Cheers在GenEval和MMBench等流行基准测试上超越Tar-1.5B,仅需训练成本的20%,表明其在有效率的统一多模态建模中具有优势。我们将发布所有代码和数据以供未来研究使用。

关键词

引用

@article{arxiv.2603.12793,
  title  = {Cheers: Decoupling Patch Details from Semantic Representations Enables Unified Multimodal Comprehension and Generation},
  author = {Yichen Zhang and Da Peng and Zonghao Guo and Zijian Zhang and Xuesong Yang and Tong Sun and Shichu Sun and Yidan Zhang and Yanghao Li and Haiyan Zhao and Wang Xu and Qi Shi and Yangang Sun and Chi Chen and Shuo Wang and Yukun Yan and Xu Han and Qiang Ma and Wei Ke and Liang Wang and Zhiyuan Liu and Maosong Sun},
  journal= {arXiv preprint arXiv:2603.12793},
  year   = {2026}
}

备注

17 pages, 5 figures