YouTubeVOS 2022 挑战赛指代表达视频目标分割任务第 1 名方案
计算机视觉与模式识别
2023-01-02 v1
摘要
指代表达视频目标分割任务旨在分割给定视频帧中指代表达式所指向的目标对象。先前的方法采用多阶段方案并设计复杂流程以取得有前景的结果。近来,基于 Transformer 的端到端方法已证明其优越性。在本工作中,我们借鉴上述方法的优势,为 RVOS 提供了一个简单而有效的流程。首先,我们改进了最先进的单阶段方法 ReferFormer,以获得与语言描述强相关的掩码序列。其次,基于可靠且高质量的参考帧,我们利用视频目标分割模型的优越性能进一步增强掩码结果的质量与时间一致性。我们的单一模型在 Referring Youtube-VOS 验证集上达到 70.3 J&F,在测试集上达到 63.0。经过集成后,我们在最终排行榜上取得 64.1,在 CVPR2022 Referring Youtube-VOS 挑战赛中排名第 1。代码将发布于 https://github.com/Zhiweihhh/cvpr2022-rvos-challenge.git。
引用
@article{arxiv.2212.14679,
title = {1st Place Solution for YouTubeVOS Challenge 2022: Referring Video Object Segmentation},
author = {Zhiwei Hu and Bo Chen and Yuan Gao and Zhilong Ji and Jinfeng Bai},
journal= {arXiv preprint arXiv:2212.14679},
year = {2023}
}
备注
4 pages, 2 figures