中文

统一的生成与理解模型能否在不同输出模态之间维持语义等价性?

计算机视觉与模式识别 2026-03-02 v1

摘要

统一多模态大语言模型(U-MLLMs)集成了理解与生成于单一架构中。然而,现有评估通常单独评估这些能力,忽略了语义等价性,即无论输出模态如何,都能表现出一致推理结果的能力。在本工作中,我们调查当前 U-MLLMs 是否满足这一前提。我们观察到,尽管模型在文本推理方面表现稳健,但在被要求以图像模态呈现相同结果时,无法维持语义等价性。为严格诊断这一差异,我们引入 VGUBench,一个解耦推理逻辑与生成保真度的框架。VGUBench 包含三个诊断任务:(1)文本生成理解,建立文本响应推理准确性的基线;(2)视觉生成理解,评估生成正确答案的视觉响应的能力;(3)视觉渲染控制任务,评估在无复杂推理情况下直接将明确的视觉描述渲染为图像的能力。我们的评估揭示了显著差异:尽管在文本理解和视觉渲染方面表现良好,U-MLLMs 在被要求生成针对问题的视觉答案时表现显著下降。进一步地,我们发现视觉回答性能与基础渲染质量之间几乎不存在相关性。这些结果表明,失败并非源于生成保真度不足,而是源于跨模态语义对齐的崩溃。我们提供诊断性见解,以在未来的统一生成与理解模型中解决这一挑战。

关键词

引用

@article{arxiv.2602.23711,
  title  = {Can Unified Generation and Understanding Models Maintain Semantic Equivalence Across Different Output Modalities?},
  author = {Hongbo Jiang and Jie Li and Yunhang Shen and Pingyang Dai and Xing Sun and Haoyu Cao and Liujuan Cao},
  journal= {arXiv preprint arXiv:2602.23711},
  year   = {2026}
}

备注

Equal contribution by Jie Li