中文

光流与文本提示如何协作以助力音视频语义分割?

计算机视觉与模式识别 2026-03-03 v2 人工智能

摘要

音视频语义分割 (AVSS) 表示为音视频分割 (AVS) 任务的扩展, necessitating 对音视频场景进行语义理解,超越仅在视觉像素层面识别声源对象。与前一方法不同,我们将 AVSS 任务分解为两个离散子任务,首先提供提示分割掩码以facilitate后续语义分析。我们的approach innovates on 此基础策略。我们引入新颖的协作框架,\'S\'tepping \'S\'tone \'P\'lus (SSP),集成光流与文本提示以助力分割过程。在声源频繁存在于移动物体的场景中,pre-mask 技巧利用光流捕获运动动力学,为精确分割提供essential temporal context。为解决静止声源对象(如报警器)的挑战,SSP 包含两个特定文本提示:一个识别声源对象的类别,另一个提供场景的更广泛描述。此外,我们实现视觉-文本对齐模块 (VTA) 以facilitate跨模态集成,提供更连贯且上下文相关的语义解释。我们的训练 regimen 采用 post-mask 技巧旨在使模型学习光流的图谱。实验结果表明,SSP 在现有 AVS 方法上实现超越,delivering efficient and precise segmentation results。

关键词

引用

@article{arxiv.2601.08133,
  title  = {How Do Optical Flow and Textual Prompts Collaborate to Assist in Audio-Visual Semantic Segmentation?},
  author = {Yujian Lee and Peng Gao and Yongqi Xu and Wentao Fan},
  journal= {arXiv preprint arXiv:2601.08133},
  year   = {2026}
}