超越准确性:统一多模态模型中跨任务一致性的基准测试
计算机视觉与模式识别
2026-04-29 v1
摘要
统一多模态模型(uMMs)旨在支持视觉理解和视觉生成两种能力,同时共享表示。然而,现有评估协议独立评估这两种能力,未检查它们在语义上是否一致。因此,尚不清楚当前的 uMMs 是否学习到连贯的统一表示,能够在给定视觉概念时保持跨任务的一致性。我们引入 XTC-Bench,一个基于场景图的评估框架,用于衡量跨任务视觉语义一致性。通过从结构化场景图中派生生成提示和理解查询,该框架实现了对对象、属性和关系的事实级别对齐分析。我们提出了连续跨任务一致性(CCTA),这是一种细粒度度量,用于量化生成和理解在匹配原子事实上的语义一致性,将内部一致性与独立任务准确性分离。对八个开源模型和一个商业模型进行大规模实验表明,高生成或理解性能并不必然意味着强大的跨任务对齐;架构分析显示,一致性由跨模态学习目标的耦合紧密程度决定,而非仅凭架构统一性。XTC-Bench 提供了一个可复现且模型无关的框架,用于诊断表示层面的误对齐,为超越孤立任务性能的统一多模态建模提供了具体方向。
引用
@article{arxiv.2604.25072,
title = {Beyond Accuracy: Benchmarking Cross-Task Consistency in Unified Multimodal Models},
author = {Weixing Wang and Liudvikas Zekas and Anton Hackl and Constantin Alexander Auga and Parisa Shahabinejad and Jona Otholt and Antonio Rueda-Toicen and Gerard de Melo},
journal= {arXiv preprint arXiv:2604.25072},
year = {2026}
}