UNINEXT-Cutie:LSVOS挑战赛RVOS赛道首个解决方案
计算机视觉与模式识别
2024-08-27 v2
摘要
指代视频目标分割(RVOS)依赖自然语言表达式对视频中的目标对象进行分割。今年的LSVOS挑战赛RVOS赛道将原有的YouTube-RVOS基准替换为MeViS。MeViS侧重于通过目标对象的运动描述而非静态属性来指代视频中的目标对象,这对RVOS任务提出了更大的挑战。在本工作中,我们整合了领先的RVOS模型和VOS模型的优势,构建了一个简单而有效的RVOS流水线。首先,我们对最先进的RVOS模型进行微调,以获得与语言描述相关的掩码序列。其次,基于可靠且高质量的关键帧,我们利用VOS模型来提升掩码结果的质量和时间一致性。最后,我们进一步利用半监督学习来提升RVOS模型的性能。我们的方案在MeViS测试集上取得了62.57的J&F得分,并在第6届LSVOS挑战赛RVOS赛道中排名首位。
引用
@article{arxiv.2408.10129,
title = {UNINEXT-Cutie: The 1st Solution for LSVOS Challenge RVOS Track},
author = {Hao Fang and Feiyu Pan and Xiankai Lu and Wei Zhang and Runmin Cong},
journal= {arXiv preprint arXiv:2408.10129},
year = {2024}
}