中文

第五届LSVOS挑战赛第一名解决方案:指代视频目标分割

计算机视觉与模式识别 2024-01-02 v1 人工智能

摘要

近年来,基于Transformer的模型因其卓越性能而在指代视频目标分割(RVOS)任务中占据主导地位。大多数先前的工作采用统一的DETR框架,以查询到实例的方式生成分割掩码。在本工作中,我们整合了领先RVOS模型的优势,构建了一种有效的范式。我们首先从RVOS模型中获取二值掩码序列。为了提高掩码的一致性和质量,我们提出了两阶段多模型融合策略。每个阶段根据框架设计和训练策略合理地集成RVOS模型,并利用不同的视频目标分割(VOS)模型通过目标传播机制增强掩码的连贯性。我们的方法在Ref-Youtube-VOS验证集上取得了75.7%的J&F,在测试集上取得了70%的J&F,在第五届大规模视频目标分割挑战赛(ICCV 2023)赛道3中排名第一。代码可在 https://github.com/RobertLuo1/iccv2023_RVOS_Challenge 获取。

关键词

引用

@article{arxiv.2401.00663,
  title  = {1st Place Solution for 5th LSVOS Challenge: Referring Video Object Segmentation},
  author = {Zhuoyan Luo and Yicheng Xiao and Yong Liu and Yitong Wang and Yansong Tang and Xiu Li and Yujiu Yang},
  journal= {arXiv preprint arXiv:2401.00663},
  year   = {2024}
}