中文

通用与任务导向的视频分割

计算机视觉与模式识别 2024-07-10 v1 人工智能

摘要

我们提出了 GvSeg,一个通用的视频分割框架,用于处理四种不同的视频分割任务(即实例、语义、全景和示例引导),同时保持相同的架构设计。目前,存在一种开发可跨多个任务应用的通用视频分割解决方案的趋势。这简化了研究工作并简化了部署。然而,当前设计中这种高度同质化的框架,其中每个元素都保持统一,可能会忽略不同任务之间固有的差异性,并导致次优性能。为了解决这个问题,GvSeg:i) 对分割目标进行了整体解耦和建模,从外观、位置和形状的角度对其进行了彻底检查,并在此基础上,ii) 根据任务特定需求重新制定了查询初始化、匹配和采样策略。这些与架构无关的创新使 GvSeg 能够通过适应每个独特任务的特征属性来有效地处理它们。在七个黄金标准基准数据集上进行的大量实验表明,GvSeg 在四种不同的视频分割任务上显著超越了所有现有的专用/通用解决方案。

关键词

引用

@article{arxiv.2407.06540,
  title  = {General and Task-Oriented Video Segmentation},
  author = {Mu Chen and Liulei Li and Wenguan Wang and Ruijie Quan and Yi Yang},
  journal= {arXiv preprint arXiv:2407.06540},
  year   = {2024}
}

备注

ECCV 2024; Project page: https://github.com/kagawa588/GvSeg