GMOS:在 3D 空间和时间中对 grounding 活动目标分割
计算机视觉与模式识别
2026-05-29 v1
摘要
活动目标分割(MOS)旨在发现、分割并跟踪独立于相机的运动目标。当前 MOS 方法存在两个根本性局限:它们依赖预计算的 2D 辅助模态(如光流或点轨迹),这些模态缺乏 3D 几何信息;它们将运动视为序列级属性,忽视了每个目标的瞬时运动状态。我们通过在 3D 空间和时间中对 MOS 进行 grounding,提出了 GMOS 框架,直接操作 RGB 视频,对多个活动目标进行 3D aware、时序细粒度分割,并推出针对快速部署的前景-背景变体 GMOS-S。为支持此范式下的训练和评估,我们策划了 GMOS-2K 数据集,包含 2,210 套真实世界视频,标注了来自五个已建立的视频对象分割(VOS)基准中的每个目标的时序运动注释,并正式化了 MOS-I(“I”指瞬时)时序细粒度评估协议,包含三个互补指标。GMOS 在 MOS、MOS-I 和无监督 VOS 基准上实现最先进结果,同时显著快于先前的多目标 MOS 方法,支持在线推理以实现流式部署。
引用
@article{arxiv.2605.30352,
title = {GMOS: Grounding Moving Object Segmentation in 3D Space and Time},
author = {Junyu Xie and Tengda Han and Weidi Xie and Andrew Zisserman},
journal= {arXiv preprint arXiv:2605.30352},
year = {2026}
}
备注
Project Page: https://www.robots.ox.ac.uk/vgg/research/gmos/