中文

MOSEv2:更具挑战性的视频对象分割复杂场景数据集

计算机视觉与模式识别 2025-09-23 v2

摘要

视频对象分割(VOS)旨在对视频中指定目标对象进行分割。尽管最先进的方法在如DAVIS和YouTube-VOS等基准上取得了惊人的性能(例如90%以上的J&F),但这些数据集主要包含显著的、支配性的、孤立的目标对象,限制了其在现实场景中的泛化能力。为弥合这一差距,coMplex video Object SEgmentation(MOSEv1)数据集被引入以促进复杂场景下的VOS研究。基于MOSEv1的基础和见解,我们present了MOSEv2,一个显著更具挑战性的数据集,旨在更好地支持现实条件下的VOS方法。MOSEv2包含5024个视频和701,976个高质量mask,覆盖10,074个对象和200个类别。与其前身相比,MOSEv2引入了更大的场景复杂度,包括{更频繁的对象消失和重现、严重的遮挡和拥挤、更小的目标对象,以及诸如恶劣天气(如雨、雪、雾)、低光场景(如夜间、 underwater)、多shot序列、伪装对象、非物理目标(如阴影、反射)以及需要外部知识的情景等新挑战}。我们在5种不同设置下对20个代表性VOS方法进行基准测试,观察到在MOSEv2上表现 consistently 下降。例如,SAM2在MOSEv1上达到76.4%,但在MOSEv2上仅为50.9%。我们进一步评估了9个视频对象跟踪方法,发现类似的下降趋势,表明MOSEv2在不同任务上都具备挑战性。这些结果表明,尽管现有方法在现有数据集上表现出色,但在现实复杂性下仍不足。基于对所观察挑战的分析,我们进一步提出了几项实用技巧,以提升模型性能。MOSEv2已公开提供,网址为https://MOSE.video。

关键词

引用

@article{arxiv.2508.05630,
  title  = {MOSEv2: A More Challenging Dataset for Video Object Segmentation in Complex Scenes},
  author = {Henghui Ding and Kaining Ying and Chang Liu and Shuting He and Xudong Jiang and Yu-Gang Jiang and Philip H. S. Torr and Song Bai},
  journal= {arXiv preprint arXiv:2508.05630},
  year   = {2025}
}

备注

MOSEv2 Dataset Report, Project Page: https://mose.video/, Baseline & metric code: https://github.com/henghuiding/MOSE-api