中文

统一多模态模型的免费晌餐:通过反思校正提升生成能力

计算机视觉与模式识别 2026-04-16 v1 人工智能

摘要

统一多模态模型(UMMs)旨在整合视觉理解与生成于单一结构中。然而,这些模型 exhibits 显著的能力不匹配,即其理解能力显著优于生成能力。这种不匹配表明,模型的丰富内部知识虽然对理解任务有效,但在生成期间未被充分激活。为解决此问题,本文借鉴人类“边画边想”(Thinking-While-Drawing)范例,其中人类持续反思以激活知识并校正中间结果。在本文中,我们提出了一种训练无关的统一校正链式思维框架,即 UniRect-CoT。我们的 метод方法揭示了 UMM 强大内在理解能力中隐藏的“免费晌餐”,通过持续反思激活其内部知识并在生成过程中校正中间结果。我们将 UMM 中的扩散去噪过程视为内在的视觉推理过程,并将中间结果与模型理解的目标指令对齐,作为自监督信号以校正 UMM 的生成。大量实验表明,UniRect-CoT 可轻松集成到现有 UMM 中,显著提升了跨 diverse 复杂任务中的生成质量。

关键词

引用

@article{arxiv.2604.13540,
  title  = {Free Lunch for Unified Multimodal Models: Enhancing Generation via Reflective Rectification with Inherent Understanding},
  author = {Yibo Jiang and Tao Wu and Rui Jiang and Yehao Lu and Chaoxiang Cai and Zequn Qin and Xi Li},
  journal= {arXiv preprint arXiv:2604.13540},
  year   = {2026}
}