中文

从开放世界视角学习视频中的物体状态变化

计算机视觉与模式识别 2024-04-04 v2

摘要

物体状态变化(Object State Changes, OSC)对视频理解至关重要。尽管人类能够毫不费力地将 OSC 理解从已知物体泛化到未知物体,但当前方法仍局限于闭集词汇。为弥补这一不足,我们引入了一种针对视频 OSC 问题的新型开放世界表述。其目标是时间定位 OSC 的三个阶段——物体的初始状态、过渡状态和结束状态——无论该物体在训练期间是否被观测到。为此,我们开发了 VidOSC,一种整体学习方法,其特点为:(1) 利用文本和视觉-语言模型提供监督信号,从而免去人工标注 OSC 训练数据;(2) 从物体中抽象出细粒度的共享状态表示以增强泛化能力。此外,我们提出了 HowToChange,这是首个用于视频 OSC 定位的开放世界基准,与现有的最佳基准相比,其标签空间和标注量均提升了一个数量级。实验结果证明了该方法在传统闭集世界和开放世界场景下的有效性。

关键词

引用

@article{arxiv.2312.11782,
  title  = {Learning Object State Changes in Videos: An Open-World Perspective},
  author = {Zihui Xue and Kumar Ashutosh and Kristen Grauman},
  journal= {arXiv preprint arXiv:2312.11782},
  year   = {2024}
}

备注

Accepted by CVPR 2024, Project website: https://vision.cs.utexas.edu/projects/VidOSC/