中文

$M^3-Verse$: 面向大型多模态模型的“找不同”挑战

计算机视觉与模式识别 2026-05-26 v2 人工智能

摘要

现代大型多模态模型(LMMs)在静态图像和单状态时空理解方面展现了惊人的能力。然而,他们理解两个不同视频观察中相同空间背景下物体动态变化的能力,仍然基本未被探索。这种在一致环境中推理转换能力,对空间智能领域的进步尤为关键。本文引入 M3VerseM^3-Verse,即多模态、多状态、多维度基准,正式评估此能力。基准基于成对视频构建,包含同一室内场景在状态变化前后的多视角观察。基准包含 270 个场景和 2,932 个问题,分为超过 50 项子任务,旨检验 4 项核心能力。我们评估了 16 种最先进的 LMMs,观察到其在跟踪状态转换方面的局限性。为解决这些挑战,我们进一步提出一种简单而有效的基线方法,在多状态感知方面取得显著性能提升。M3VerseM^3-Verse 因此提供了一个具有挑战性的新测试平台,以催化下一代模型在动态视觉世界中更全面理解能力的发展。可从 https://github.com/Wal-K-aWay/M3-Verse_pipeline 获取构建流程,从 https://www.modelscope.cn/datasets/WalKaWay/M3-Verse 获取完整基准数据。

关键词

引用

@article{arxiv.2512.18735,
  title  = {$M^3-Verse$: A "Spot the Difference" Challenge for Large Multimodal Models},
  author = {Kewei Wei and Bocheng Hu and Jie Cao and Xiaohan Chen and Zhengxi Lu and Wubing Xia and Weili Xu and Jiaao Wu and Junchen He and Mingyu Jia and Ciyun Zhao and Ye Sun and Yizhi Li and Zhonghan Zhao and Jian Zhang and Gaoang Wang},
  journal= {arXiv preprint arXiv:2512.18735},
  year   = {2026}
}