MOSEv2 挑战赛 2025 第二名成果报告:基于 SeC 的概念引导视频对象分割
计算机视觉与模式识别
2025-09-30 v1
摘要
半监督视频对象分割旨在以第一帧掩码为初始化,在视频序列中对指定目标进行分割。以往方法依赖外观特征匹配,难以应对剧烈视觉变化、遮挡和场景切换等挑战,这源于缺乏对目标的高层次概念理解。最近提出的 Segment Concept(SeC)框架通过使用大规模视觉语言模型(LVLM)建立深层语义理解,从而实现更持久的分割。本文评估了 SeC 在具有挑战性的 coMplex video Object SEgmentation v2(MOSEv2)数据集上的零样性能。未经训练集微调,SeC 在测试集上达到了 39.7% 的 JMean 分数,并在第 7 届大规模视频对象分割挑战赛的 Complex VOS 轨道中获得第二名。
引用
@article{arxiv.2509.23838,
title = {2nd Place Report of MOSEv2 Challenge 2025: Concept Guided Video Object Segmentation via SeC},
author = {Zhixiong Zhang and Shuangrui Ding and Xiaoyi Dong and Yuhang Zang and Yuhang Cao and Jiaqi Wang},
journal= {arXiv preprint arXiv:2509.23838},
year = {2025}
}