中文

MMCORE:结合表征对齐潜在嵌入的多模态连接

计算机视觉与模式识别 2026-04-23 v1 人工智能 机器学习

摘要

我们提出了MMCORE,一个为多模态图像生成与编辑设计的统一框架。MMCORE利用预训练的视觉语言模型通过可学习的查询令牌预测语义视觉嵌入,随后将其作为扩散模型的条件信号。这种精简的设计有效地将VLMs丰富的理解和推理能力转移到视觉生成过程中。通过免除自回归模型与扩散模型之间的深度融合或从头训练的需要,MMCORE在保持高保真合成的同时显著降低了计算开销。MMCORE将文本到图像合成与交错图像生成无缝集成,在空间推理和视觉定位等复杂场景中展示了强大的多模态理解能力。全面评估表明,MMCORE在广泛的文本到图像和单/多图像编辑基准上始终优于SOTA基线。

关键词

引用

@article{arxiv.2604.19902,
  title  = {MMCORE: MultiModal COnnection with Representation Aligned Latent Embeddings},
  author = {Zijie Li and Yichun Shi and Jingxiang Sun and Ye Wang and Yixuan Huang and Zhiyao Guo and Xiaochen Lian and Peihao Zhu and Yu Tian and Zhonghua Zhai and Peng Wang},
  journal= {arXiv preprint arXiv:2604.19902},
  year   = {2026}
}