中文

打破视频对象分割中的“对象”

计算机视觉与模式识别 2023-03-29 v2

摘要

当对象发生转变时,其外观可能是转瞬即逝的。当鸡蛋被打破或纸张被撕碎时,它们的颜色、形状和纹理会发生剧烈变化,除身份本身外几乎不保留任何原始特征。然而,这一重要现象在现有视频对象分割(VOS)基准中基本缺失。在本工作中,我们通过收集一个用于变换下视频对象分割(VOST)的新数据集来弥补这一差距。该数据集包含700多个高分辨率视频,拍摄于多样环境中,平均时长21秒,并用实例掩码进行了密集标注。我们采用了一种谨慎的多步骤方法,以确保这些视频聚焦于复杂的对象变换,捕捉其完整的时间跨度。然后我们广泛评估了最先进的VOS方法,并做出了若干重要发现。特别地,我们表明现有方法在应用于这一新任务时表现不佳,其主要局限在于对静态外观线索的过度依赖。这促使我们为性能最佳的基线提出一些修改,通过更好地建模时空信息来提升其能力。但更广泛地说,希望借此激发关于学习更鲁棒的视频对象表示的讨论。

关键词

引用

@article{arxiv.2212.06200,
  title  = {Breaking the "Object" in Video Object Segmentation},
  author = {Pavel Tokmakov and Jie Li and Adrien Gaidon},
  journal= {arXiv preprint arXiv:2212.06200},
  year   = {2023}
}