中文

第5届LSVOS挑战赛视频实例分割赛道冠军方案

计算机视觉与模式识别 2023-08-29 v1

摘要

视频实例分割是一项具有挑战性的任务,是包括视频编辑和自动驾驶在内的众多下游应用的基石。在本报告中,我们对SOTA VIS方法DVIS进行了进一步改进。首先,我们为可训练跟踪器引入了去噪训练策略,使其能够在复杂和长视频中实现更稳定且准确的目标跟踪。此外,我们探索了视觉基础模型在视频实例分割中的作用。通过使用DINO v2预训练的冻结VIT-L模型,DVIS表现出显著的性能提升。借助这些增强,我们的方法在开发和测试阶段分别取得了57.9 AP和56.0 AP,并最终在第五届LSVOS挑战赛的VIS赛道中排名第一。代码将发布于https://github.com/zhang-tao-whu/DVIS。

关键词

引用

@article{arxiv.2308.14392,
  title  = {1st Place Solution for the 5th LSVOS Challenge: Video Instance Segmentation},
  author = {Tao Zhang and Xingye Tian and Yikang Zhou and Yu Wu and Shunping Ji and Cilin Yan and Xuebo Wang and Xin Tao and Yuan Zhang and Pengfei Wan},
  journal= {arXiv preprint arXiv:2308.14392},
  year   = {2023}
}