中文

遮挡视频实例分割:一个基准

计算机视觉与模式识别 2022-05-18 v6

摘要

我们的视频理解系统能否在场景存在严重遮挡时感知物体?为回答此问题,我们收集了一个称为 OVIS 的大规模数据集,用于遮挡视频实例分割,即同时在遮挡场景中检测、分割并跟踪实例。OVIS 包含来自 25 个语义类别的 296k 高质量实例掩码,其中物体遮挡经常发生。虽然我们的人眼视觉系统可通过上下文推理与关联理解那些被遮挡的实例,我们的实验表明当前的视频理解系统不能。在 OVIS 数据集上,最先进算法取得的最高 AP 仅为 16.3,这揭示我们在真实场景理解物体、实例与视频方面仍处于起步阶段。我们还提出了一个简单的即插即用模块,执行时间特征校准以补充由遮挡导致的缺失物体线索。基于 MaskTrack R-CNN 和 SipMask 构建,我们在 OVIS 数据集上获得了显著的 AP 提升。OVIS 数据集与项目代码可在 http://songbai.site/ovis 获取。

关键词

引用

@article{arxiv.2102.01558,
  title  = {Occluded Video Instance Segmentation: A Benchmark},
  author = {Jiyang Qi and Yan Gao and Yao Hu and Xinggang Wang and Xiaoyu Liu and Xiang Bai and Serge Belongie and Alan Yuille and Philip H. S. Torr and Song Bai},
  journal= {arXiv preprint arXiv:2102.01558},
  year   = {2022}
}

备注

IJCV 2022. Project page at https://songbai.site/ovis