学习关联每一片段以实现视频全景分割
计算机视觉与模式识别
2021-06-18 v1
摘要
时间对应——跨帧关联像素或物体——是视频模型的基本监督信号。针对动态场景的全景理解,我们进一步将这一概念扩展到每一个片段。具体而言,我们旨在同时学习粗粒度的片段级匹配与细粒度的像素级匹配。我们通过设计两个新颖的学习目标来实现这一想法。为验证我们的方案,我们采用一个深度连体模型,并训练该模型在与目标任务一起的同时,学习两个不同层级(即片段与像素)上的时间对应。在推理时,该模型独立处理每一帧,无需任何额外计算与后处理。我们表明,我们的逐帧推理模型在 Cityscapes-VPS 与 VIPER 数据集上取得了新的最先进(state-of-the-art, SOTA)结果。此外,由于其高效率,该模型的运行时间仅为先前最先进方法的三分之一(3倍加速)。
引用
@article{arxiv.2106.09453,
title = {Learning to Associate Every Segment for Video Panoptic Segmentation},
author = {Sanghyun Woo and Dahun Kim and Joon-Young Lee and In So Kweon},
journal= {arXiv preprint arXiv:2106.09453},
year = {2021}
}
备注
Accepted to CVPR2021