M$^3$-VOS:多阶段、多转变与多场景视频目标分割
计算机视觉与模式识别
2025-06-03 v3 人工智能
摘要
智能机器人需要在各种环境中与多样的目标进行交互。目标的外观和状态会根据其属性(如相变)频繁经历复杂的转变。然而,在计算机视觉领域,对具有相变的动态目标进行分割一直被忽视。鉴于此,我们在分割中引入了“阶段”的概念,该概念基于真实世界目标的视觉特征及其潜在的形态与外观变化对其进行分类。随后,我们提出了一个新的基准——多阶段、多转变与多场景视频目标分割(M-VOS),以验证模型理解目标阶段的能力,该基准包含跨越 10 余种不同日常场景的 479 个高分辨率视频。它提供了密集的实例掩码标注,捕捉了目标的阶段及其转变。我们在 M-VOS 上评估了最先进的方法,得出了几个关键见解。值得注意的是,当前基于外观的方法在处理具有相变的目标时仍有很大的改进空间。无序度的内在变化表明,正向熵增过程的预测性能可以通过逆向熵减过程来提升。这些发现促使我们提出了 ReVOS,一种通过逆向精修来提升性能的新型即插即用模型。我们的数据和代码将公开于 https://zixuan-chen.github.io/M-cube-VOS.github.io/。
引用
@article{arxiv.2412.13803,
title = {M$^3$-VOS: Multi-Phase, Multi-Transition, and Multi-Scenery Video Object Segmentation},
author = {Zixuan Chen and Jiaxin Li and Liming Tan and Yejie Guo and Junxuan Liang and Cewu Lu and Yong-Lu Li},
journal= {arXiv preprint arXiv:2412.13803},
year = {2025}
}
备注
18 pages, 12 figures