SAMWISE:将智慧注入SAM2以实现文本驱动视频分割
计算机视觉与模式识别
2025-03-26 v2
摘要
指涕式视频对象分割(RVOS)依赖于自然语言表达式对视频剪辑中的对象进行分割。现有方法要么将推理限制在独立的短片段中,丢失全局上下文,要么处理整个视频离线,影响其以流式方式应用。在本工作中,我们旨是突破这些限制,设计一种能够在流式场景下有效运行,同时保留来自过去帧的上下文信息的RVOS方法。我们基于提供鲁棒分割和跟踪能力且天然适用于流处理的Segment-Anything 2(SAM2)模型进行构建。通过在特征提取阶段赋予其自然语言理解和显式的时间建模能力,使SAM2更聪明,而无需对其权重进行微调,也无需将模态交互外包给外部模型。为此,我们引入了新的适配器模块,在特征提取过程中注入时间信息和多模态线索。我们进一步揭示了SAM2中的跟踪偏差现象,并提出可调整的可学习模块以根据当前帧特征建议的更符合标题的新对象来调整其跟踪焦点。我们提出的方法SAMWISE在各种基准测试中实现了最先进的性能,仅增加了不到5百万参数的开销。代码可在https://github.com/ClaudiaCuttano/SAMWISE 获取。
引用
@article{arxiv.2411.17646,
title = {SAMWISE: Infusing Wisdom in SAM2 for Text-Driven Video Segmentation},
author = {Claudia Cuttano and Gabriele Trivigno and Gabriele Rosi and Carlo Masone and Giuseppe Averta},
journal= {arXiv preprint arXiv:2411.17646},
year = {2025}
}
备注
CVPR 2025. Project page: https://claudiacuttano.github.io/SAMWISE