中文

判别式时空-语义视频对象分割方案:第 6 届 LSVOS 赛事获奖方案

计算机视觉与模式识别 2024-08-30 v1

摘要

视频对象分割(VOS)是计算机视觉中的关键任务,但当前的 VOS 方法在处理复杂场景和持续的物体运动方面存在挑战。为此目的,MOSE 数据集旨在增强对象在复杂环境中的识别和区分能力,而 LVOS 数据集则聚焦于分割表现出长期、复杂运动的物体。本报告介绍了一种判别式时空 VOS 模型,该模型利用判别式物体特征作为查询表示。语义理解的时空-语义模块使其能够识别物体的不同部分,而显著特征则突出显示更具辨识度的物体特征。我们的模型在大规模 VOS 数据集上进行训练,在 VOS 轨道的第 6 届 LSVOS 赛事测试集上取得了第一名成绩(J&F\mathcal{J \& F} 为 80.90%),展示了其应对上述挑战的有效性。该代码将在 \href{https://github.com/yahooo-m/VOS-Solution}{code} 公开。

关键词

引用

@article{arxiv.2408.16431,
  title  = {Discriminative Spatial-Semantic VOS Solution: 1st Place Solution for 6th LSVOS},
  author = {Deshui Miao and Yameng Gu and Xin Li and Zhenyu He and Yaowei Wang and Ming-Hsuan Yang},
  journal= {arXiv preprint arXiv:2408.16431},
  year   = {2024}
}

备注

1st Place Solution for 6th LSVOS VOS Track. arXiv admin note: substantial text overlap with arXiv:2406.04600