中文

PushupBench:您的 VLM 在计数推肩举时并不擅长

计算机视觉与模式识别 2026-04-28 v1 人工智能

摘要

大型视觉语言模型 (VLM) 能够识别视频中发生了什么,但在计数时却无法准确判断发生了多少次。我们引入 PushupBench,这是一组 446 个时长较长的视频片段(平均时长 36.7 秒),用于评估重复计数。最佳前沿模型实现 42.1% 的完全准确率;开源 4B 模型得分约为 6%,与受监督的基线相当。我们表明,准确率本身会误导——较弱的模型利用模态计数,而非进行时序推理。针对计数进行微调仅需 1000 个样本,即可迁移到更广泛的视频理解任务:MVBench (+2.15),PerceptionTest (+1.88),TVBench (+4.54),表明计数是更广泛时序推理的代理任务。PushupBench 已集成至 lmms-eval (https://github.com/EvolvingLMMs-Lab/lmms-eval/pull/1262) 中,并在 pushupbench.com/ 上提供。

关键词

引用

@article{arxiv.2604.23407,
  title  = {PushupBench: Your VLM is not good at counting pushups},
  author = {Shengzhi Li and Jiarun Chen and Karun Sharma and Jiaqi Su and Shichao Pei},
  journal= {arXiv preprint arXiv:2604.23407},
  year   = {2026}
}