中文

TOMATO: 评估多模态基础模型的视觉时序推理能力

计算机视觉与模式识别 2025-08-26 v2 人工智能 计算与语言

摘要

现有基准测试通常强调最先进的多模态基础模型(MFMs)在利用时序上下文进行视频理解方面取得的显著性能。然而,这些模型在视觉时序推理方面的真实表现如何?我们对现有基准测试的研究表明,MFMs 的这一能力可能被高估了,因为许多问题可以通过使用单个、少数或顺序错乱的帧来解决。为了系统地审视当前的视觉时序推理任务,我们提出了三条原则及相应的度量指标:(1)多帧增益(Multi-Frame Gain),(2)帧序敏感性(Frame Order Sensitivity),(3)帧信息差异(Frame Information Disparity)。遵循这些原则,我们引入了 TOMATO(Temporal Reasoning Multimodal Evaluation),一个旨在严格评估 MFMs 在视频理解中时序推理能力的新基准。TOMATO 包含 1,484 个精心策划的人工标注问题,涵盖六个任务(即动作计数、方向、旋转、形状与趋势、速度与频率和视觉线索),应用于 1,417 个视频,包括 805 个自录和自生成视频,涵盖以人为中心、现实世界和模拟场景。我们的综合评估揭示了最佳模型与人类表现之间 57.3% 的差距。此外,我们的深入分析揭示了当前 MFMs 在这一差距之外的更多根本性局限。虽然它们能够准确识别孤立帧中的事件,但它们无法将这些帧解释为连续序列。我们相信 TOMATO 将成为评估下一代 MFMs 的重要测试平台,并呼吁社区开发能够通过视频模态理解人类世界动态的 AI 系统。

关键词

引用

@article{arxiv.2410.23266,
  title  = {TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models},
  author = {Ziyao Shangguan and Chuhan Li and Yuxuan Ding and Yanan Zheng and Yilun Zhao and Tesca Fitzgerald and Arman Cohan},
  journal= {arXiv preprint arXiv:2410.23266},
  year   = {2025}
}