中文

SOUPLE:用于提升音视频定位与分割的可学习提示上下文

计算机视觉与模式识别 2026-03-25 v1

摘要

大规模预训练图像文本模型表现出鲁棒的多模态表示,但将对比语言-图像预训练(CLIP)模型应用于音视频定位仍存在挑战。用音频嵌入令([V_A])取代分类令([CLS])难以捕获语义线索,提示词“a photo of a [V_A]”也无法在音频嵌入与上下文令之间建立有意义的联系。为此,我们提出了声音感知提示学习(Sound-aware Prompt Learning, SOUPLE),用可学习的上下文令取代固定提示词。这些令整合视觉特征,为掩码解码器生成条件上下文,从而有效桥接音频与视觉输入之间的语义对应关系。在 VGGSound、SoundNet 和 AVSBench 上的实验表明,SOUPLE 提升了定位和分割性能。

关键词

引用

@article{arxiv.2603.22732,
  title  = {SOUPLE: Enhancing Audio-Visual Localization and Segmentation with Learnable Prompt Contexts},
  author = {Khanh Binh Nguyen and Chae Jung Park},
  journal= {arXiv preprint arXiv:2603.22732},
  year   = {2026}
}

备注

Accepted to CVPR 2026