低资源真实场景下基于音视频信息融合的声事件定位与检测探索
音频与语音处理
2024-06-24 v1 信号处理
摘要
本研究提出一种基于音视频信息融合的方法,用于在低资源场景下的声事件定位与检测(SELD)。本研究旨在通过跨模态学习和多模态融合,利用音频和视频模态信息。首先,我们提出了一种跨模态教师-学生学习(TSL)框架,用于将在丰富音频数据上(通过多种数据增强技术)训练的音频-only教师模型中的信息传递给仅使用有限多模态数据训练的音频-视频学生模型。接着,我们提出了两种阶段的音频-视频融合策略,包括早期特征融合和后期视频引导决策融合,以利用音频和视频模态之间的协同效应。最后,我们引入一种创新的视频像素置换(VPS)技术,将音频通道置换(ACS)方法扩展到音视频联合增强。在Detection and Classification of Acoustic Scenes and Events(DCASE)2023挑战数据集上的评估结果表明,本方法在SELD性能上实现了显著提升。此外,我们对DCASE 2023挑战中SELD任务的提交结果在有效集成所提出技术后模型集成方面名列第一。
引用
@article{arxiv.2406.15160,
title = {Exploring Audio-Visual Information Fusion for Sound Event Localization and Detection In Low-Resource Realistic Scenarios},
author = {Ya Jiang and Qing Wang and Jun Du and Maocheng Hu and Pengfei Hu and Zeyan Liu and Shi Cheng and Zhaoxu Nian and Yuxuan Dong and Mingqi Cai and Xin Fang and Chin-Hui Lee},
journal= {arXiv preprint arXiv:2406.15160},
year = {2024}
}
备注
accepted by icme2024