中文

论时序记号之魔:高质量视频推理分割

计算机视觉与模式识别 2025-03-03 v1 人工智能

摘要

现有视频推理分割方法依赖单一特殊记号代表关键帧或 entire video 中的对象,无法充分捕捉空间复杂性和帧间运动。为克服这些挑战,我们提出了 VRS-HQ,一种基于多模态大语言模型 (MLLM) 的端到端视频推理分割方法,通过层次化记号注入丰富的时空特征。我们的关键创新包括时序动态聚合 (TDA) 和记号驱动的关键帧选择 (TKS)。具体而言,我们设计了帧级 <SEG> 和时序级 <TAK> 记号,利用 MLLM 的自回归学习有效捕捉局部和全局信息。随后,我们应用基于相似度的加权融合和帧选择策略,再利用 SAM2 执行关键帧分割和传递。为提高关键帧定位精度,TKS 根据 SAM2 的遮挡得分过滤关键帧。VRS-HQ 在 ReVOS 数据集上实现最先进的性能,相较于 VISA 在三个子集的 J&F 分数提升了 5.9%/12.5%/9.1%。这些结果凸显了我们方法的强大时序推理和分割能力。代码和模型权重将在 VRS-HQ 公开。

关键词

引用

@article{arxiv.2501.08549,
  title  = {The Devil is in Temporal Token: High Quality Video Reasoning Segmentation},
  author = {Sitong Gong and Yunzhi Zhuge and Lu Zhang and Zongxin Yang and Pingping Zhang and Huchuan Lu},
  journal= {arXiv preprint arXiv:2501.08549},
  year   = {2025}
}