VGenST-Bench:基于主动视频合成的时空推理基准
计算机视觉与模式识别
2026-05-22 v1 人工智能
摘要
时空推理是多模态大语言模型(MLLMs)在现实世界中核心能力。因此,对其进行精确评估已成为关键挑战。然而,现有时空推理基准数据集主要依赖静态图像集合或被动精选的视频数据,这限制了对细粒度推理能力的评估。本文引入VGenST-Bench,一个采用生成模型主动合成高度受控且多样化评估场景的视频基准。为构建VGenST-Bench,我们提出了多智能体管道,包含人类质量控制阶段,确保所有生成视频和问答对的质量。我们建立了覆盖空间尺度、视角和场景动态的综合性3×2×2视频分类,涵盖多样化场景。此外,我们设计了分层任务套件,将低级视觉感知与高级时空推理解耦。通过从被动精选转向主动合成,VGenST-Bench实现了对MLLMs时空理解的细粒度诊断。
引用
@article{arxiv.2605.22570,
title = {VGenST-Bench: A Benchmark for Spatio-Temporal Reasoning via Active Video Synthesis},
author = {Jinho Park and Youbin Kim and Hogun Park and Eunbyung Park},
journal= {arXiv preprint arXiv:2605.22570},
year = {2026}
}
备注
82 pages, 91 figures (7 in main paper, 84 in appendix). Project page: https://zinosii.github.io/VGenST-Bench/