SoundLoc3D:基于多模态 RGB-D 声学相机的隐形 3D 声源定位与分类
声音
2024-12-31 v2 计算机视觉与模式识别
多媒体
音频与语音处理
摘要
准确地定位 3D 声源并估计其语义标签——在这些场景中,声源可能不可见,但假设它们位于场景中物体的物理表面上——具有许多实际应用,包括检测气体泄漏和机械故障。在此设置下,音视频之间的弱相关性为从跨模态信息中解决该任务的创新方法带来了新挑战。为此,我们提出使用由透视 RGB-D 相机和共平面四通道麦克风阵列(Mic-Array)组成的声学相机装置。通过该装置从多视角记录音视频信号,我们可以使用跨模态线索来估计声源的 3D 位置。具体而言,我们的框架 SoundLoc3D 将任务视为一个集合预测问题,其中集合中的每个元素对应于一个潜在的声源。鉴于音视频的弱相关,该集合表示最初从单个视图麦克风阵列信号中学习,然后通过主动融合来自多视角 RGB-D 图像中暴露的物理表面线索进行细化。我们在大规模模拟数据集上展示了 SoundLoc3D 的效率和优越性,并进一步显示其对 RGB-D 测量不准确和环境噪声干扰的鲁棒性。
引用
@article{arxiv.2412.16861,
title = {SoundLoc3D: Invisible 3D Sound Source Localization and Classification Using a Multimodal RGB-D Acoustic Camera},
author = {Yuhang He and Sangyun Shin and Anoop Cherian and Niki Trigoni and Andrew Markham},
journal= {arXiv preprint arXiv:2412.16861},
year = {2024}
}
备注
Accepted by WACV2025