VISOLO:基于网格的时空聚合用于高效的在线视频实例分割
计算机视觉与模式识别
2022-03-31 v2
摘要
对于在线视频实例分割(VIS),以高效的方式充分利用先前帧的信息对于实时应用至关重要。大多数先前的方法遵循需要额外计算(如RPN和RoIAlign)的两阶段方法,并且没有充分利用视频中可用于VIS所有子任务的信息。在本文中,我们提出了一种基于网格结构特征表示构建的在线VIS单阶段新框架。基于网格的特征使我们能够采用全卷积网络进行实时处理,并且能够轻松地在不同组件中复用和共享特征。我们还引入了协同操作的模块,以聚合来自可用帧的信息,从而丰富VIS中所有子任务的特征。我们的设计以高效的方式为VIS中的所有任务充分利用了网格形式的先前信息,并在YouTube-VIS 2019和2021数据集上实现了在线VIS方法中最新的SOTA准确率(38.6 AP和36.9 AP)和速度(40.0 FPS)。代码可在 https://github.com/SuHoHan95/VISOLO 获取。
引用
@article{arxiv.2112.04177,
title = {VISOLO: Grid-Based Space-Time Aggregation for Efficient Online Video Instance Segmentation},
author = {Su Ho Han and Sukjun Hwang and Seoung Wug Oh and Yeonchool Park and Hyunwoo Kim and Min-Jung Kim and Seon Joo Kim},
journal= {arXiv preprint arXiv:2112.04177},
year = {2022}
}