中文

MeViS:一个基于运动表达的大规模视频分割基准

计算机视觉与模式识别 2023-08-17 v1

摘要

本文致力于运动表达引导的视频分割,其重点是根据描述物体运动的句子对视频内容中的物体进行分割。现有的指称视频物体数据集通常关注显著物体,并使用包含过多静态属性的语言表述,这些属性可能使目标物体能在单帧中被识别。这些数据集淡化了视频内容中运动对于语言引导视频物体分割的重要性。为探究使用运动表达来定位并分割视频中物体的可行性,我们提出一个名为 MeViS 的大规模数据集,其包含大量运动表达以在复杂环境中指示目标物体。我们对 5 种现有的指称视频物体分割(referring video object segmentation, RVOS)方法进行了基准测试,并在 MeViS 数据集上进行了全面比较。结果表明,当前 RVOS 方法无法有效解决运动表达引导的视频分割。我们进一步分析了挑战,并为所提出的 MeViS 数据集给出一个基线方法。我们基准测试的目标是提供一个平台,使能够有效利用运动表达作为复杂视频场景中物体分割主要线索的语言引导视频分割算法得以发展。所提出的 MeViS 数据集已发布于 https://henghuiding.github.io/MeViS。

关键词

引用

@article{arxiv.2308.08544,
  title  = {MeViS: A Large-scale Benchmark for Video Segmentation with Motion Expressions},
  author = {Henghui Ding and Chang Liu and Shuting He and Xudong Jiang and Chen Change Loy},
  journal= {arXiv preprint arXiv:2308.08544},
  year   = {2023}
}

备注

ICCV 2023, Project Page: https://henghuiding.github.io/MeViS/