中文

伪统一:熵探针揭示统一多模态模型中的异质信息模式

计算机视觉与模式识别 2026-04-14 v1 人工智能

摘要

统一多模态模型 (UMMs) 旨在将大型语言模型 (LLMs) 的推理能力与视觉模型的生成能力相结合。然而,实际情况并非如此:UMMs 未能将 LLM 类的推理 transferred to image synthesis,表现出异质的响应行为。我们称这种现象为 pseudo-unification。诊断其内部原因至关重要,但现有探针方法要么缺乏对模型内部的洞察,要么忽略 prompt-response 之间的依赖。为此,我们提出一种信息论探针框架,联合分析 UMMs 如何编码输入和生成输出。应用于十个代表性 UMMs 时,我们的框架揭示了 pseudo-unification 源于双重发散:(i) 模态非对称编码,视觉和语言遵循不同的熵轨迹;(ii) 模式分裂响应,文本生成表现出高熵的创造性,而图像合成则强制执行低熵的忠实性。只有通过在两侧进行统一 (例如通过情境预测) 的模型才能实现更真实的统一,进而即使参数更少也能实现更强的基于推理的 text-to-image 生成。我们的工作提供了对统一的首个模型内部探针,表明真正的多模态协同不仅仅需要共享参数,而需要在信息流动方面保持一致性。

关键词

引用

@article{arxiv.2604.10949,
  title  = {Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models},
  author = {Songlin Yang and Xianghao Kong and Anyi Rao},
  journal= {arXiv preprint arXiv:2604.10949},
  year   = {2026}
}