解耦分割标记提升视频分割与 grounding 能力
计算机视觉与模式识别
2025-07-01 v1 人工智能
摘要
现有的视频分割与 grounding 方法(以 Sa2VA 为例)直接在分割模型中融合特征,常导致动态视觉信息与静态语义信息被错误耦合,从而降低分割精度。为系统性缓解此问题,我们提出 DeSa2VA,一种集成文本预训练和线性解耦模块的解耦增强提示方案,以解决 SAM-2 固有的局限性。具体方法:首先,我们设计一种预训练范式,将文本 ground-truth 标签转换为点级提示,同时生成对应的文本掩码。这些掩码通过混合损失函数进行细化,以强化模型的语义 grounding 能力。接着,我们采用线性投影将由大语言模型生成的隐藏状态解耦为独立的文本和视觉特征子空间。最后,一种动态掩码融合策略通过对预测文本/视觉掩码和 ground-truth 标注的三重监督,协同融合这些解耦特征。大量实验表明,该方法在包括图像分割、图像问答、视频分割和视频问答等多种任务上实现了最先进的性能。我们的代码已公开于 https://github.com/longmalongma/DeSa2VA。
引用
@article{arxiv.2506.22880,
title = {Decoupled Seg Tokens Make Stronger Reasoning Video Segmenter and Grounder},
author = {Dang Jisheng and Wu Xudong and Wang Bimei and Lv Ning and Chen Jiayu and Jingwen Zhao and Yichu liu and Jizhao Liu and Juncheng Li and Teng Wang},
journal= {arXiv preprint arXiv:2506.22880},
year = {2025}
}