中文

ActionVOS:将动作作为视频对象分割的提示

计算机视觉与模式识别 2024-07-11 v1

摘要

在以观察者视角为主的视觉领域, referring video object segmentation (RVOS) 的发展是理解人类活动的关键步骤。然而,现有的 RVOS 任务主要依赖于静态属性(如对象名称)来进行目标对象分割,这在区分目标对象与背景对象以及识别正在发生状态变化的对象方面存在挑战。为此,本文提出了一种新颖的面向动作感知的 RVOS 设置,称为 ActionVOS,即利用人类动作作为关键语言提示,对 egocentric 视频中仅处于主动状态的对象进行分割。这是因为人类动作精确描述了人的行为,从而有助于识别真正参与互动的对象并理解可能的状态变化。我们还构建了一个针对该特定设置的专用方法。具体而言,我们开发了带有高效动作引导焦点损失的动作感知标注模块。此设计使 ActionVOS 模型能够优先处理带有现成标注的主动对象。在 VISOR 数据集上的实验结果表明,ActionVOS 显著减少了非活跃对象的误分割,证明了动作有助于模型理解对象参与情况。进一步的在 VOST 和 VSCOS 数据集上的评估显示,新颖的 ActionVOS 设置在面对涉及对象状态变化的挑战性情境时,能够提升分割性能。我们将在 https://github.com/ut-vision/ActionVOS 上提供实现代码。

关键词

引用

@article{arxiv.2407.07402,
  title  = {ActionVOS: Actions as Prompts for Video Object Segmentation},
  author = {Liangyang Ouyang and Ruicong Liu and Yifei Huang and Ryosuke Furuta and Yoichi Sato},
  journal= {arXiv preprint arXiv:2407.07402},
  year   = {2024}
}

备注

This paper is accepted by ECCV2024. Code will be released at https://github.com/ut-vision/ActionVOS