Tube-Link:一种用于通用视频分割的灵活跨管框架
计算机视觉与模式识别
2023-08-22 v3
摘要
视频分割旨在准确分割并跟踪多样场景中的每一像素。本文中,我们提出 Tube-Link,一种以统一架构解决视频分割多个核心任务的通用框架。我们的框架是一种近在线方法,以短子片段为输入并输出相应的时空管掩码。为增强跨管关系建模,我们提出一种沿查询进行注意力操作以实现管级链接的有效方式。此外,我们引入时间对比学习以获得实例级判别特征用于管级关联。我们的方法对长短视频输入均具灵活性与高效性,因各子片段长度可根据数据集或场景需求变化。Tube-Link 在五个视频分割数据集上以显著优势超越现有专用架构。具体而言,相比强基线 Video K-Net,其在 VIPSeg 上取得近 13% 相对提升,在 KITTI-STEP 上提升 4%。当在 Youtube-VIS-2019 与 2021 上使用 ResNet50 骨干时,Tube-Link 分别将 IDOL 提升 3% 与 4%。
引用
@article{arxiv.2303.12782,
title = {Tube-Link: A Flexible Cross Tube Framework for Universal Video Segmentation},
author = {Xiangtai Li and Haobo Yuan and Wenwei Zhang and Guangliang Cheng and Jiangmiao Pang and Chen Change Loy},
journal= {arXiv preprint arXiv:2303.12782},
year = {2023}
}
备注
ICCV-2023, Project page: https://github.com/lxtGH/Tube-Link (fix typos and errors, update the results)