中文

SAM2-LOVE:语言辅助视听场景中的 Segment Anything Model 2

计算机视觉与模式识别 2025-06-03 v1

摘要

参考视听分割旨在为语言辅助视听场景提供像素级的场景理解。该任务要求模型从视频中连续分割由文本和音频所指代的目标。以往的双模态方法由于缺乏第三模态而总是失败,而现有的三模态方法在时空一致性上存在困难,导致不同帧的目标偏移。在这项工作中,我们引入了一个名为 SAM2-LOVE 的新框架,该框架将文本、音频和视觉表示集成到一个可学习的 token 中,以提示并对齐 SAM2,从而在 LAVS 中实现 Ref-AVS。在技术上,我们的方法包括一个旨在改善 SAM2 多模态理解的多模态融合模块,以及旨在增强时空一致性而不遗忘历史信息的 token 传播和累积策略。我们进行了大量实验,证明 SAM2-LOVE 在 Ref-AVS 基准上的 J&F\mathcal{J\&F} 比 SOTA 高出 8.5\%,并展示了各组件的简单性和有效性。我们的代码将在此处提供。

关键词

引用

@article{arxiv.2506.01558,
  title  = {SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes},
  author = {Yuji Wang and Haoran Xu and Yong Liu and Jiaze Li and Yansong Tang},
  journal= {arXiv preprint arXiv:2506.01558},
  year   = {2025}
}

备注

CVPR 2025