EC-Bench:超长视频的枚举与计数基准
计算机视觉与模式识别
2026-04-01 v1
摘要
在计算机视觉中,长视频计数仍是基本且未被充分探索的挑战。实际场景的录像往往持续数十分钟甚至更久,包含稀疏且多样化的事件,这使得长程时序推理尤为困难。然而,大多数现有视频计数基准仅聚焦于短片段,并仅评估最终的numerical答案,无法洞察应计数的对象或模型在时间上是否一致识别相关实例。我们引入 EC-Bench,一个同时评估枚举、计数及时序证据定位的基准测试集。EC-Bench 包含 152 个时长超过 30 分钟的视频,以及 1,699 条配有明确证据跨度的查询。针对 22 个多模态大语言模型(MLLMs),最佳模型在枚举任务上仅达到 29.98% 的准确率,计数任务为 23.74%,而人类水平分别达到 78.57% 和 82.97%。我们的分析揭示了枚举准确率、时序定位与计数表现之间的强关联。这些结果凸显当前 MLLM 的根本性局限,确立 EC-Bench 作为长形式定性视频推理的挑战性基准。
引用
@article{arxiv.2603.29943,
title = {EC-Bench: Enumeration and Counting Benchmark for Ultra-Long Videos},
author = {Fumihiko Tsuchiya and Taiki Miyanishi and Mahiro Ukai and Nakamasa Inoue and Shuhei Kurita and Yusuke Iwasawa and Yutaka Matsuo},
journal= {arXiv preprint arXiv:2603.29943},
year = {2026}
}
备注
The first two authors are equally contributed. The data and code are publicly available at: https://github.com/matsuolab/EC-Bench