中文

Video K-Net:一种简洁、强大且统一的视频分割基线

计算机视觉与模式识别 2022-10-20 v2

摘要

本文提出 Video K-Net,一种用于全端到端视频全景分割的简洁、强大且统一的框架。该方法构建于 K-Net 之上,K-Net 是通过一组可学习核统一图像分割的方法。我们观察到,K-Net 中编码对象外观与上下文的这些可学习核可自然关联视频帧间相同实例。受此观察启发,Video K-Net 通过基于核的简单外观建模与跨时间核交互,学习同时分割并跟踪视频中的“thing”与“stuff”。尽管简洁,它在 Cityscapes-VPS、KITTI-STEP 和 VIPSeg 上无需额外技巧即取得 SOTA 视频全景分割结果。尤其在 KITTI-STEP 上,该简洁方法相较以往方法提升近 12% 相对改进。在 VIPSeg 上,Video K-Net 提升近 15% 相对改进并取得 39.8% VPQ。我们还在视频语义分割上验证其泛化性,在 VSPW 数据集上提升各类基线 2%。此外,我们将 K-Net 扩展为视频实例分割的片段级视频框架,在 YouTube-2019 验证集上以 ResNet50 骨干取得 40.5% mAP、以 Swin-base 取得 54.1% mAP。我们希望这一简洁而有效的方法能作为统一视频分割设计中新的灵活基线。代码与模型发布于 https://github.com/lxtGH/Video-K-Net。

关键词

引用

@article{arxiv.2204.04656,
  title  = {Video K-Net: A Simple, Strong, and Unified Baseline for Video Segmentation},
  author = {Xiangtai Li and Wenwei Zhang and Jiangmiao Pang and Kai Chen and Guangliang Cheng and Yunhai Tong and Chen Change Loy},
  journal= {arXiv preprint arXiv:2204.04656},
  year   = {2022}
}

备注

Accepted by CVPR-2022(oral); Add more experiments. Code is available at https://github.com/lxtGH/Video-K-Net