用于在线视频实例分割的两级时间关系模型
计算机视觉与模式识别
2022-11-01 v1
摘要
在视频实例分割(VIS)中,现有方法或关注结果质量,将整段视频作为输入并离线处理;或关注速度,逐帧处理但以牺牲竞争性性能为代价。本文提出一种在线方法,其性能与离线方法相当。我们引入一个消息传递图神经网络来编码目标并随时间建立关联。我们还提出一个新模块,通过残差连接融合来自特征金字塔网络的特征。我们的模型端到端训练,在 YouTube-VIS 数据集上于在线方法中取得最优性能。在 DAVIS 上的进一步实验展示了模型向视频目标分割任务的泛化能力。代码见:\url{https://github.com/caganselim/TLTM}
引用
@article{arxiv.2210.16795,
title = {Two-Level Temporal Relation Model for Online Video Instance Segmentation},
author = {Çağan Selim Çoban and Oğuzhan Keskin and Jordi Pont-Tuset and Fatma Güney},
journal= {arXiv preprint arXiv:2210.16795},
year = {2022}
}