中文

MovSAM:基于深度思考的单图像移动物体分割框架

计算机视觉与模式识别 2025-04-10 v1

摘要

移动物体分割在理解动态视觉环境中发挥着关键作用。虽然现有方法依赖多帧图像序列来识别移动物体,但单图像移动物体分割对于运动意图预测和处理相机帧丢失等应用场景至关重要。然而,由于缺乏时间线索,现有方法仍难以从单张图像中分割移动物体。为解决这一问题,我们提出了MovSAM——首个针对单图像移动物体分割的框架。MovSAM利用以链式思维(Chain-of-Thought, CoT)提示词增强的多模态大语言模型(Multimodal Large Language Model, MLLM),进行深度思考后搜索移动物体并生成用于分割的文本提示词。这些提示词与基于分割任何模型(Segment Anything Model, SAM)和视觉语言模型(Vision-Language Model, VLM)提取的视觉特征进行交叉融合,实现逻辑驱动的移动物体分割。随后,分割结果 undergoes deep thinking refinement loop,使MovSAM能够迭代地改进对场景上下文和物体间关系的理解。这种创新方法使MovSAM能够通过考虑场景理解来对单张图像中的移动物体进行分割。我们在实际场景中实现MovSAM,以验证其在自动驾驶场景中的实际应用效果,此场景下多帧方法会失败。此外,尽管多帧方法在利用时间信息方面具有固有的优势,MovSAM仍在公开的移动物体分割基准测试中实现了最先进的性能,J&F指标达到92.5%。我们的实现将在https://github.com/IRMVLab/MovSAM 上提供。

关键词

引用

@article{arxiv.2504.06863,
  title  = {MovSAM: A Single-image Moving Object Segmentation Framework Based on Deep Thinking},
  author = {Chang Nie and Yiqing Xu and Guangming Wang and Zhe Liu and Yanzi Miao and Hesheng Wang},
  journal= {arXiv preprint arXiv:2504.06863},
  year   = {2025}
}