第五届LSVOS挑战赛第一名解决方案:指代视频目标分割
计算机视觉与模式识别
2024-01-02 v1 人工智能
摘要
近年来,基于Transformer的模型因其卓越性能而在指代视频目标分割(RVOS)任务中占据主导地位。大多数先前的工作采用统一的DETR框架,以查询到实例的方式生成分割掩码。在本工作中,我们整合了领先RVOS模型的优势,构建了一种有效的范式。我们首先从RVOS模型中获取二值掩码序列。为了提高掩码的一致性和质量,我们提出了两阶段多模型融合策略。每个阶段根据框架设计和训练策略合理地集成RVOS模型,并利用不同的视频目标分割(VOS)模型通过目标传播机制增强掩码的连贯性。我们的方法在Ref-Youtube-VOS验证集上取得了75.7%的J&F,在测试集上取得了70%的J&F,在第五届大规模视频目标分割挑战赛(ICCV 2023)赛道3中排名第一。代码可在 https://github.com/RobertLuo1/iccv2023_RVOS_Challenge 获取。
引用
@article{arxiv.2401.00663,
title = {1st Place Solution for 5th LSVOS Challenge: Referring Video Object Segmentation},
author = {Zhuoyan Luo and Yicheng Xiao and Yong Liu and Yitong Wang and Yansong Tang and Xiu Li and Yujiu Yang},
journal= {arXiv preprint arXiv:2401.00663},
year = {2024}
}