判别式时空-语义视频对象分割方案:第 6 届 LSVOS 赛事获奖方案
计算机视觉与模式识别
2024-08-30 v1
摘要
视频对象分割(VOS)是计算机视觉中的关键任务,但当前的 VOS 方法在处理复杂场景和持续的物体运动方面存在挑战。为此目的,MOSE 数据集旨在增强对象在复杂环境中的识别和区分能力,而 LVOS 数据集则聚焦于分割表现出长期、复杂运动的物体。本报告介绍了一种判别式时空 VOS 模型,该模型利用判别式物体特征作为查询表示。语义理解的时空-语义模块使其能够识别物体的不同部分,而显著特征则突出显示更具辨识度的物体特征。我们的模型在大规模 VOS 数据集上进行训练,在 VOS 轨道的第 6 届 LSVOS 赛事测试集上取得了第一名成绩( 为 80.90%),展示了其应对上述挑战的有效性。该代码将在 \href{https://github.com/yahooo-m/VOS-Solution}{code} 公开。
引用
@article{arxiv.2408.16431,
title = {Discriminative Spatial-Semantic VOS Solution: 1st Place Solution for 6th LSVOS},
author = {Deshui Miao and Yameng Gu and Xin Li and Zhenyu He and Yaowei Wang and Ming-Hsuan Yang},
journal= {arXiv preprint arXiv:2408.16431},
year = {2024}
}
备注
1st Place Solution for 6th LSVOS VOS Track. arXiv admin note: substantial text overlap with arXiv:2406.04600