AV-SSAN:通过显式多带语义-空间对齐进行音视频选择性 DoA 估计
声音
2025-08-07 v2 音频与语音处理
摘要
音视频声源定位(AV-SSL)通过融合听觉和视觉线索来估计声源的位置。当前的 AV-SSL 方法通常需要空间上配对的音视频数据,无法对特定目标源进行选择性定位。为此,我们提出了跨实例音视频定位(CI-AVL)——一种使用来自相同语义类别不同实例的视觉提示来定位目标声源的新任务。CI-AVL 实现了无需空间配对数据即可进行选择性定位。为解决此任务,我们提出了 AV-SSAN,一个以多带语义-空间对齐网络(MB-SSA Net)为中心的语义-空间对齐框架。MB-SSA Net 将音频语谱分解为多个频率带,分别与语义视觉提示对齐,然后细化空间线索以估计声源到达方向(DoA)。为促进此项研究,我们构建了 VGGSound-SSL 数据集,包含 13,981 个跨 296 个类别的空间音频剪辑,每段配有视觉提示。AV-SSAN 实现了 16.59 的平均绝对误差和 71.29% 的准确率,显著优于现有的 AV-SSL 方法。代码和数据将公开。
引用
@article{arxiv.2507.07384,
title = {AV-SSAN: Audio-Visual Selective DoA Estimation through Explicit Multi-Band Semantic-Spatial Alignment},
author = {Yu Chen and Hongxu Zhu and Jiadong Wang and Kainan Chen and Xinyuan Qian},
journal= {arXiv preprint arXiv:2507.07384},
year = {2025}
}
备注
9 pages