基于跟踪查询的鲁棒在线视频实例分割
计算机视觉与模式识别
2022-11-17 v1
摘要
近年来,基于 transformer 的方法在视频实例分割(VIS)上取得了令人印象深刻的成果。然而,这些表现最优的方法大多以离线方式运行,通过一次性处理整个视频片段来预测实例掩码体。这使得它们无法处理具有挑战性的新视频实例分割数据集(如 UVO 和 OVIS)中出现的长视频。我们提出了一种完全在线的基于 transformer 的视频实例分割模型,该模型在 YouTube-VIS 2019 基准上可与顶尖离线方法相媲美,并在 UVO 和 OVIS 上大幅优于它们。该方法称为鲁棒在线视频分割(ROVIS),它用跟踪查询(track queries)增强了 Mask2Former 图像实例分割模型,跟踪查询是一种将跟踪信息从帧传递到帧的轻量级机制,最初由 TrackFormer 方法为多目标跟踪引入。我们表明,当与足够强大的图像分割架构结合时,跟踪查询可以展现出令人印象深刻的精度,同时不受短视频的约束。
引用
@article{arxiv.2211.09108,
title = {Robust Online Video Instance Segmentation with Track Queries},
author = {Zitong Zhan and Daniel McKee and Svetlana Lazebnik},
journal= {arXiv preprint arXiv:2211.09108},
year = {2022}
}