中文

SPOC:视频中空间渐进式对象状态变化分割

计算机视觉与模式识别 2025-12-25 v2

摘要

视频中对象的状态变化揭示了关于人类和智能体活动的关键线索。然而,现有方法仅限于时间定位对象处于初始状态(如奶酪块)与其完成状态变化(如刨丝奶酪)的时间,无法提供变化正在展开位置的信息。本研究通过引入空间渐进式对象状态变化分割任务来深化这一问题。目标是在像素级别分割对象中可操作区域和已转换区域。我们表明,最先进的视觉-语言模型和视频分割方法在此任务上表现不佳,凸显了其难度和新颖性。作为初步基线,我们设计了一种基于 VLM 的伪标签方法、状态变化动力学约束,以及一个基于野外互联网视频构建的新型 WhereToChange 基准。两个数据集上的实验验证了新任务的挑战性以及我们的模型在精确定位视频中对象变化位置和变化速度方面的潜力。我们进一步展示了其对跟踪活动进展以造福机器人智能体的有用应用。总体而言,我们的工作将空间 OSC 分割定位为视频理解的新前沿任务:一项挑战现有最先进方法并邀请社区构建更鲁棒、状态变化敏感表示的任务。项目页面:https://vision.cs.utexas.edu/projects/spoc-spatially-progressing-osc

关键词

引用

@article{arxiv.2503.11953,
  title  = {SPOC: Spatially-Progressing Object State Change Segmentation in Video},
  author = {Priyanka Mandikal and Tushar Nagarajan and Alex Stoken and Zihui Xue and Kristen Grauman},
  journal= {arXiv preprint arXiv:2503.11953},
  year   = {2025}
}

备注

Accepted at WACV 2026