中文

统一多模态理解与生成的视觉表征和谐化

计算机视觉与模式识别 2025-04-23 v2

摘要

在单个多模态框架中统一视觉理解与生成仍是一个显著的挑战,因为这两种任务本质上异构,需处于不同的粒度水平上。当前采用向量量化(VQ)或变分自编码器(VAE)进行统一视觉表征的方法,优先考虑图像的内在特征而忽视语义,导致理解性能受损。本文借鉴掩码图像建模(MIM)通过掩码-重构预训练学习丰富语义的做法,以及其成功扩展至掩码自回归(MAR)图像生成的方法,发现MAR编码器的表征在线性探测准确率极高,特征响应精准地对应视觉概念,这表明MAR在理解任务中具有巨大的潜力。基于这些洞察,我们提出了\emph{Harmon}——一个统一自回归框架,通过共享的MAR编码器实现对理解与生成任务的和谐。通过三阶段训练过程逐步优化理解与生成能力,Harmon在GenEval、MJHQ30K和WISE基准上实现了图像生成的最新性能,同时在理解基准上与采用专用语义编码器(如Janus)的方法保持一致。我们的代码和模型将在https://github.com/wusize/Harmon发布。

关键词

引用

@article{arxiv.2503.21979,
  title  = {Harmonizing Visual Representations for Unified Multimodal Understanding and Generation},
  author = {Size Wu and Wenwei Zhang and Lumin Xu and Sheng Jin and Zhonghua Wu and Qingyi Tao and Wentao Liu and Wei Li and Chen Change Loy},
  journal= {arXiv preprint arXiv:2503.21979},
  year   = {2025}
}