Slot-VPS:面向视频全景分割的以对象为中心表示学习
计算机视觉与模式识别
2021-12-17 v1 机器学习
摘要
视频全景分割(VPS)旨在为每像素分配类别标签,并在所有帧中一致地唯一分割与识别所有对象实例。经典方案通常将VPS任务分解为若干子任务,并利用多个代理(如框与掩码、中心与偏移)来表示对象。然而,这种分而治之策略在时空域均需复杂后处理,且易受代理任务失败的影响。本文受以对象为中心学习(学习紧凑且鲁棒的对象表示)启发,提出Slot-VPS,即该任务的首个端到端框架。我们用称为全景槽(panoptic slots)的统一表示编码视频中所有全景实体,包括前景实例与背景语义。所提出的视频全景检索器(Video Panoptic Retriever)检索连贯的时空对象信息并编码入全景槽,使其以统一方式定位、分割、区分与关联对象。最终,输出的全景槽可直接转换为视频中全景对象的类别、掩码与对象ID。我们进行了充分消融研究,并在两个基准数据集Cityscapes-VPS(\textit{val}与test集)和VIPER(\textit{val}集)上证明了方法有效性,分别取得63.7、63.3与56.2 VPQ的新的SOTA性能。
引用
@article{arxiv.2112.08949,
title = {Slot-VPS: Object-centric Representation Learning for Video Panoptic Segmentation},
author = {Yi Zhou and Hui Zhang and Hana Lee and Shuyang Sun and Pingjun Li and Yangguang Zhu and ByungIn Yoo and Xiaojuan Qi and Jae-Joon Han},
journal= {arXiv preprint arXiv:2112.08949},
year = {2021}
}