中文

SVAG-Bench:用于多实例时空视频动作定位的大规模基准

计算机视觉与模式识别 2026-05-15 v3

摘要

truly capable 的 AI 系统不仅要检测对象或识别孤立情境,还要构建谁在做什么、这些动作何时何地发生的统一、落脚的表征。这些表征为高层推理、规划和现实世界中的具身交互提供感知基础。构建此类智能体是具身 AI 与机器人中长期目标的核心。当前视频基准在孤立场景下评估这些能力的不同片段,仅关注空间定位、目标跟踪或时间局部化,无法严格衡量其联合、多实例集成的进展。我们引入时空视频动作定位 (Spatio-temporal Video Action Grounding, SVAG),以要求模型在复杂多演员场景中同时检测、跟踪和 temporally 定位满足自然语言查询的所有对象,显式针对这种统一能力。为支持此任务,我们构建了 SVAG-Bench。其包含 688 个视频、19,590 条经过验证的标注、903 个独特动作动词,涵盖拥挤城市环境、野生动物及交通监控场景。每个视频平均有 28.5 条以动作为中心的查询。这使得其在可比较视频定位基准中标注密度最稠密,可对多演员消歧、时间重叠和动作组合性进行细粒度评估。标注通过结合专家手动标注、GPT-3.5 释义增强和人类验证的管道生成,确保语言多样性和正确性。我们进一步发布了 SVAGEval,一个标准化的多指代评估工具包。我们还引入了 SVAGFormer,一个强大的模块化基线架构用于 SVAG。

关键词

引用

@article{arxiv.2510.13016,
  title  = {SVAG-Bench: A Large-Scale Benchmark for Multi-Instance Spatio-temporal Video Action Grounding},
  author = {Tanveer Hannan and Shuaicong Wu and Mark Weber and Suprosanna Shit and Jindong Gu and Rajat Koner and Aljoša Ošep and Laura Leal-Taixé and Thomas Seidl},
  journal= {arXiv preprint arXiv:2510.13016},
  year   = {2026}
}