SYNCR: 一种具有合成基真值的跨视频推理基准
计算机视觉与模式识别
2026-05-12 v1
摘要
多模态大语言模型(MLLMs)在单视频理解方面取得了快速进展,但其跨多个独立视频流进行推理的能力仍知之甚少。现有的多视频基准主要依赖人工标注的真实世界视频,限制了空间、时间和物理基真值的精度,并使得诊断模型失败变得困难。我们引入了SYNCR,一个用于跨视频推理的受控合成基准,具有程序化验证的基真值。利用Habitat、Kubric和CLEVRER模拟引擎构建,SYNCR包含8,163个多视频问答对,基于9,650个独特视频。它评估MLLMs在四个诊断支柱上的八项任务:时间对齐、空间追踪、比较推理和整体综合。我们对领先的开源和闭源MLLMs进行的零样本评估揭示了当前模型与人类之间的巨大差距:最佳模型平均准确率仅为52.5%,而人类基线为89.5%。模型在时间排序上表现相对较好,但在精确的物理和空间推理上存在困难,最佳模型在运动学比较上的准确率仅为26.0%。我们进一步发现,参数缩放和推理专用后训练改善了时间对齐能力,但未能可靠地解决细粒度物理追踪或全局空间综合。最后,一项探索性的模拟到现实相关性分析表明,SYNCR的若干任务追踪了模型在真实世界多视频基准上的趋势,同时也揭示了现有评估未充分代表的推理能力。代码可在https://github.com/SaraGhazanfari/SYNCR获取。
引用
@article{arxiv.2605.08412,
title = {SYNCR: A Cross-Video Reasoning Benchmark with Synthetic Grounding},
author = {Sara Ghazanfari and Siddharth Garg and Prashanth Krishnamurthy and Farshad Khorrami},
journal= {arXiv preprint arXiv:2605.08412},
year = {2026}
}