VCBench:用于长视频中空间-时间状态维护的流式计数基准
计算机视觉与模式识别
2026-03-26 v2
摘要
视频理解需要模型在播放过程中持续跟踪和更新世界状态。虽然现有基准在多个维度上推进了视频理解评估,但关于模型如何维护世界状态的观察仍不足。我们提出了 VCBench,即一种将计数重新定位为诊断世界状态维护能力的最小探针的流式计数基准。我们将这种能力分解为对象计数和事件计数,形成 8 个细粒度子类别。对象计数涵盖跟踪当前可见对象和累计唯一身份标识,事件计数涵盖检测瞬时动作和跟踪完整活动周期。VCBench 包含 406 个视频,包含 10,071 个事件发生时刻和对象状态变化时刻的逐帧标注,生成 1,000 个流式问答对,沿时间线包含 4,576 个查询点。通过观察状态维护轨迹的流式多点查询,我们设计了三个互补的指标来诊断数值精度、轨迹一致性和时间感知能力。在主流视频-语言模型上进行评估显示,当前模型在空间-时间状态维护方面仍存在显著不足,尤其在诸如周期性事件计数等任务上表现得不佳。VCBench 为衡量和改进视频理解系统中的状态维护提供了诊断框架。我们的代码和数据已提供于 https://github.com/buaaplay/VCBench。
引用
@article{arxiv.2603.12703,
title = {VCBench: A Streaming Counting Benchmark for Spatial-Temporal State Maintenance in Long Videos},
author = {Pengyiang Liu and Zhongyue Shi and Hongye Hao and Qi Fu and Xueting Bi and Siwei Zhang and Xiaoyang Hu and Zitian Wang and Linjiang Huang and Si Liu},
journal= {arXiv preprint arXiv:2603.12703},
year = {2026}
}