中文

电话游戏:评估统一模型中的语义漂移

计算机视觉与模式识别 2025-10-07 v2 计算与语言

摘要

采用单一统一模型(UM)同时进行视觉理解(图像到文本:I2T)和视觉生成(文本到图像:T2I)为视觉语言模型(VLM)研究开辟了新方向。虽然 UM 也能支持更广泛的单模态任务(如文本到文本、图像到图像),但我们重点关注核心的跨模态对 T2I 和 I2T。现有的评估基准将这些能力孤立看待:T2I 使用 FID 和 GenEval,I2T 使用 MME、MMBench 等基准。这些孤立的单次指标无法揭示跨一致性:一个“理解”了某个概念的模型是否也能“渲染”该概念,以及在图像和文本模态之间循环时语义是否得以保持。为此,我们提出了面向统一模型的语义漂移协议(SDP),这是一种循环评估协议,通过在多代生成中交替进行 I2T 和 T2I 来量化语义漂移。我们提出两个指标: 平均累积漂移(MCD),一种基于嵌入的总体语义漂移度量; 多代 GenEval(MGG),一种扩展 GenEval 的对象级合规性得分。为了评估在训练中广泛使用的 COCO 数据集之外的泛化能力,我们创建了一个新基准 Nocaps+Docci400,从 NoCaps 和 DOCCI 中采样,并在七个近期模型上进行评估。SDP 揭示了跨模态稳定性的显著差异:一些模型(如 BAGEL)在多次交替中能保持语义,而其他模型(如 VILA-U)尽管单次得分很高,却会迅速漂移。我们的结果凸显了 SDP 是标准 I2T 和 T2I 评估的必要补充。代码可在 https://github.com/mollahsabbir/Semantic-Drift-in-Unified-Models 获取

关键词

引用

@article{arxiv.2509.04438,
  title  = {The Telephone Game: Evaluating Semantic Drift in Unified Models},
  author = {Sabbir Mollah and Rohit Gupta and Sirnam Swetha and Qingyang Liu and Ahnaf Munir and Mubarak Shah},
  journal= {arXiv preprint arXiv:2509.04438},
  year   = {2025}
}