面向视频全景分割的任务融合
计算机视觉与模式识别
2021-08-10 v1 人工智能
图像与视频处理
摘要
本文研究了视频全景分割任务,并提出两种不同的方法来解决该任务。视频全景分割(VPS)是一项新近提出的计算机视觉任务,要求对给定视频中的每个像素进行分类和跟踪。该任务的特性使得为其标注数据集的成本极其高昂。为了理解视频全景分割,本文首先研究早期提出的、分别关注语义和跟踪的组成任务。随后,选择两种无需在定制的 VPS 数据集上训练的数据驱动方法来解决该任务。第一种方法展示了如何通过启发式地融合预训练的语义分割模型和预训练的多目标跟踪模型的输出,来构建视频全景分割模型。如果希望轻松扩展任一模型的能力,这种方法是理想的。第二种方法通过在共享神经网络主干上构建任务特定头来克服第一种方法的一些缺陷。该网络专为全景分割设计,并通过一个掩码传播模块进行扩展,以跨时间链接实例掩码,从而生成视频全景分割格式。
引用
@article{arxiv.2108.04223,
title = {Merging Tasks for Video Panoptic Segmentation},
author = {Jake Rap and Panagiotis Meletis},
journal= {arXiv preprint arXiv:2108.04223},
year = {2021}
}
备注
Bachelor Thesis