用于声事件定位与检测的音频与视觉嵌入融合
音频与语音处理
2023-12-15 v1 声音
图像与视频处理
摘要
声事件定位与检测结合了两个子任务:声事件检测和到达方向估计。SELD 通常被视为纯音频问题来解决,但最近已纳入了视觉信息。目前已发表的音视频 SELD 工作很少,且大多数通过人脸/物体边界框或人体姿态关键点来利用视觉信息。相比之下,我们探索了融合由预训练深度网络提取的音频和视觉特征嵌入。对于视觉模态,我们测试了 ResNet50 和 Inflated 3D ConvNet (I3D)。我们对 AV 融合方法的比较包括 AV-Conformer 和跨模态注意力融合模型。我们表现最佳的模型在 STARSS23 数据集的开发集上大幅优于 DCASE 2023 Task3 的纯音频和 AV 基线,使其在 AV 挑战赛的 SOTA 结果中具有竞争力,且无需模型集成、重度数据增强或预测后处理。这些技术以及进一步的预训练可作为下一步以提高性能。
引用
@article{arxiv.2312.09034,
title = {Fusion of Audio and Visual Embeddings for Sound Event Localization and Detection},
author = {Davide Berghi and Peipei Wu and Jinzheng Zhao and Wenwu Wang and Philip J. B. Jackson},
journal= {arXiv preprint arXiv:2312.09034},
year = {2023}
}
备注
ICASSP 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)