SOUPLE:用于提升音视频定位与分割的可学习提示上下文
计算机视觉与模式识别
2026-03-25 v1
摘要
大规模预训练图像文本模型表现出鲁棒的多模态表示,但将对比语言-图像预训练(CLIP)模型应用于音视频定位仍存在挑战。用音频嵌入令([V_A])取代分类令([CLS])难以捕获语义线索,提示词“a photo of a [V_A]”也无法在音频嵌入与上下文令之间建立有意义的联系。为此,我们提出了声音感知提示学习(Sound-aware Prompt Learning, SOUPLE),用可学习的上下文令取代固定提示词。这些令整合视觉特征,为掩码解码器生成条件上下文,从而有效桥接音频与视觉输入之间的语义对应关系。在 VGGSound、SoundNet 和 AVSBench 上的实验表明,SOUPLE 提升了定位和分割性能。
引用
@article{arxiv.2603.22732,
title = {SOUPLE: Enhancing Audio-Visual Localization and Segmentation with Learnable Prompt Contexts},
author = {Khanh Binh Nguyen and Chae Jung Park},
journal= {arXiv preprint arXiv:2603.22732},
year = {2026}
}
备注
Accepted to CVPR 2026