中文

MomentSeg:基于时刻中心的采样以增强视频像素理解

计算机视觉与模式识别 2025-10-13 v1

摘要

指代视频对象分割(RefVOS)旨在根据自然语言描述分割视频中的目标对象,要求同时具备时间推理和细粒度视觉理解能力。现有基于 LLM 方法的采样策略通常依赖于手工设计的启发式方法或外部关键帧模型。前者常常忽略关键的时间线索,而后者增加了系统复杂性。为了解决这一问题,我们提出了一种联合优化时间句子定位(TSG)和 RefVOS 的统一框架,自然地融入了关键时刻定位能力。在训练过程中,我们引入了一种新的 TSG 范式,使用专用的 \texttt{[FIND]} 令牌通过时间令牌相似度匹配来识别关键时刻,从而避免了对外部时间戳编码的需求。在推理阶段,我们设计了一种时刻中心采样(MCS)策略,该策略密集采样信息丰富的时刻,同时稀疏采样非必要帧,保留了运动细节和全局上下文。为了进一步增强跟踪稳定性,我们开发了双向锚点更新传播(BAP),它利用最相关的时刻作为高质量掩码初始化的起点,并在采样点动态更新以减轻累积误差。代码和模型将发布于:https://github.com/Dmmm1997/MomentSeg

关键词

引用

@article{arxiv.2510.09274,
  title  = {MomentSeg: Moment-Centric Sampling for Enhanced Video Pixel Understanding},
  author = {Ming Dai and Sen Yang and Boqiang Duan and Wankou Yang and Jingdong Wang},
  journal= {arXiv preprint arXiv:2510.09274},
  year   = {2025}
}