中文

ToG-Bench:自我中心视频中的任务导向时空定位

计算机视觉与模式识别 2026-04-07 v2 人工智能

摘要

迈向通用具身智能的核心能力之一是从自我中心视角定位任务相关对象,这被形式化为时空视频定位(STVG)。尽管近期取得了进展,现有的 STVG 研究仍主要局限于以对象为中心和描述性指令,忽视了具身智能体完成目标导向交互所必需的任务导向推理。为了弥合这一差距,我们引入了 ToG-Bench——首个面向自我中心视频的任务导向时空视频定位基准。ToG-Bench 具有三个关键特征:(1)任务导向定位,要求基于预期任务而非直接描述来识别和定位对象;(2)显式-隐式双重定位,其中目标对象可以被显式提及或通过上下文推理隐式推断;(3)一对多定位,其中单条指令可能对应任务执行中涉及的多个对象。基于来自 ScanNet 的视频,ToG-Bench 包含 100 个标注片段和 2,704 条任务导向定位指令,通过结合基础模型标注与人工优化的半自动化流程构建。此外,我们引入了一套针对多对象和显式-隐式对象定位的任务级评估指标,并对七种最先进的 MLLMs 进行了系统性基准测试。大量实验揭示了任务导向 STVG 的内在挑战以及显式-隐式和多对象定位之间的显著性能差距,凸显了在具身场景中桥接感知与交互的困难。数据和代码将在 https://github.com/qaxuDev/ToG-Bench 发布。

关键词

引用

@article{arxiv.2512.03666,
  title  = {ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos},
  author = {Qi'ao Xu and Tianwen Qian and Yuqian Fu and Kailing Li and Yang Jiao and Jiacheng Zhang and Xiaoling Wang and Liang He},
  journal= {arXiv preprint arXiv:2512.03666},
  year   = {2026}
}

备注

26 pages