统一多模态理解与生成的视觉表征和谐化
计算机视觉与模式识别
2025-04-23 v2
摘要
在单个多模态框架中统一视觉理解与生成仍是一个显著的挑战,因为这两种任务本质上异构,需处于不同的粒度水平上。当前采用向量量化(VQ)或变分自编码器(VAE)进行统一视觉表征的方法,优先考虑图像的内在特征而忽视语义,导致理解性能受损。本文借鉴掩码图像建模(MIM)通过掩码-重构预训练学习丰富语义的做法,以及其成功扩展至掩码自回归(MAR)图像生成的方法,发现MAR编码器的表征在线性探测准确率极高,特征响应精准地对应视觉概念,这表明MAR在理解任务中具有巨大的潜力。基于这些洞察,我们提出了\emph{Harmon}——一个统一自回归框架,通过共享的MAR编码器实现对理解与生成任务的和谐。通过三阶段训练过程逐步优化理解与生成能力,Harmon在GenEval、MJHQ30K和WISE基准上实现了图像生成的最新性能,同时在理解基准上与采用专用语义编码器(如Janus)的方法保持一致。我们的代码和模型将在https://github.com/wusize/Harmon发布。
引用
@article{arxiv.2503.21979,
title = {Harmonizing Visual Representations for Unified Multimodal Understanding and Generation},
author = {Size Wu and Wenwei Zhang and Lumin Xu and Sheng Jin and Zhonghua Wu and Qingyi Tao and Wentao Liu and Wei Li and Chen Change Loy},
journal= {arXiv preprint arXiv:2503.21979},
year = {2025}
}