中文

AuralSAM2:通过金字塔音视频特征提示使 SAM2 获得听觉能力

计算机视觉与模式识别 2026-05-15 v2

摘要

Segment Anything Model 2 (SAM2) 在视频片段的可提示分割中展现出强大的泛化能力;然而,其与音频模态的融合仍有待深入探索。现有方法要么通过基础模型将音频转换为视觉提示(如边界框),要么在图像编码器中注入适配器以实现音视频融合。然而,由于提示精度有限且推理开销增加,这两个方向在人机交互场景中均存在不足。特别是,基于适配器的方法常遭遇音频提示稀释问题,即信号在网络中传播时逐渐减弱。本文提出 AuralSAM2,在大幅保留 SAM2 可提示分割能力的同时将音频融入其中。其核心模块 AuralFuser 融合音频与视觉特征以生成稀疏和稠密提示。这些提示以音频为引导并基于 SAM2 的特征金字塔构建,跨视觉层传播听觉线索,从而增强跨模态影响。为进一步对齐模态,我们引入音频引导的对比损失,以强调主导视觉特征中的听觉相关性。该方法在公开基准上取得了显著的精度提升,且对可提示分割的交互效率影响极小。代码已开源于 https://github.com/yyliu01/AuralSAM2。

关键词

引用

@article{arxiv.2506.01015,
  title  = {AuralSAM2: Enabling SAM2 Hear Through Pyramid Audio-Visual Feature Prompting},
  author = {Yuyuan Liu and Yuanhong Chen and Chong Wang and Junlin Han and Junde Wu and Can Peng and Jingkun Chen and Yu Tian and Gustavo Carneiro},
  journal= {arXiv preprint arXiv:2506.01015},
  year   = {2026}
}

备注

Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026