中文

基于帧间注意力的目标传播以实现时间稳定的视频实例分割

计算机视觉与模式识别 2021-12-15 v3

摘要

视频实例分割旨在检测、分割并跟踪视频中的目标。现有方法将图像级分割算法扩展到时间域,但这会导致时间上不一致的掩码。在本工作中,我们确定由时间稳定性引起的掩码质量问题是性能瓶颈。受此启发,我们提出一种缓解因漏检所导致问题的视频实例分割方法。由于仅利用空间信息无法解决该问题,我们通过帧间注意力来利用时间上下文。这使得我们的网络能够利用相邻帧的边界框预测重新聚焦于缺失目标,从而克服漏检。我们的方法在使用 Mask R-CNN 骨干网络时,通过在 YouTube-VIS 基准上取得 36.0% mAP,显著优于先前的最优算法。此外,我们的方法完全在线且不需要未来帧。我们的代码已公开于 https://github.com/anirudh-chakravarthy/ObjProp。

关键词

引用

@article{arxiv.2111.07529,
  title  = {Object Propagation via Inter-Frame Attentions for Temporally Stable Video Instance Segmentation},
  author = {Anirudh S Chakravarthy and Won-Dong Jang and Zudi Lin and Donglai Wei and Song Bai and Hanspeter Pfister},
  journal= {arXiv preprint arXiv:2111.07529},
  year   = {2021}
}

备注

Accepted at CVPR RVSU Workshop 2021