中文

TarViS:一种面向基于目标的视频分割的统一方法

计算机视觉与模式识别 2023-05-11 v2 人工智能 机器学习

摘要

视频分割的通用领域目前被分割为跨越多个基准的不同任务。尽管最先进水平进展迅速,当前方法绝大多数是任务特定的,无法在概念上泛化到其他任务。受近期具有多任务能力的方法启发,我们提出 TarViS:一种新颖的统一网络架构,可应用于任何需要在视频中分割一组任意定义的“目标”的任务。我们的方法对于这些目标如何被任务定义是灵活的,因为它将后者建模为抽象的“查询”,然后用于预测像素精确的目标掩码。单个 TarViS 模型可以在跨越不同任务的多个数据集上联合训练,并能在推理期间在任务间热切换而无需任何任务特定的重训练。为证明其有效性,我们将 TarViS 应用于四个不同任务,即视频实例分割(VIS)、视频全景分割(VPS)、视频对象分割(VOS)和点示例引导跟踪(PET)。我们统一联合训练的模型在跨越这四个任务的 7 个基准中的 5 个上达到了最先进性能,并在其余两个上具有竞争性能。代码和模型权重可在 https://github.com/Ali2500/TarViS 获取。

关键词

引用

@article{arxiv.2301.02657,
  title  = {TarViS: A Unified Approach for Target-based Video Segmentation},
  author = {Ali Athar and Alexander Hermans and Jonathon Luiten and Deva Ramanan and Bastian Leibe},
  journal= {arXiv preprint arXiv:2301.02657},
  year   = {2023}
}

备注

Accepted to CVPR'23 (Highlight). Code is available at: https://github.com/Ali2500/TarViS