基于ResNet-Conformer声学建模的四阶段数据增强方法用于声音事件定位与检测
声音
2023-03-08 v2 音频与语音处理
摘要
本文提出一种新颖的基于ResNet-Conformer声学建模的四阶段数据增强方法,用于声音事件定位与检测(SELD)。首先,我们探索了两种空间增强技术,即音频通道交换(ACS)和多通道模拟(MCS),以应对SELD中的数据稀疏性。ACS和MCS侧重于通过扩展到达方向(DOA)表示来增强有限的训练数据,使得利用增强数据训练的声学模型对声源定位变化具有鲁棒性。接下来,还研究了时域混合(TDM)和时频掩蔽(TFM)以应对重叠声音事件和数据多样性问题。最后,ACS、MCS、TDM和TFM以逐步方式组合,形成有效的四阶段数据增强方案。在声学场景与事件检测及分类(DCASE)2020数据集上测试,我们提出的增强方法大幅提升了系统性能,使我们在DCASE 2020挑战赛的SELD任务中提交的系统排名第一。此外,我们采用ResNet-Conformer架构对音频序列的全局与局部上下文依赖进行建模,并在DCASE 2022 SELD评测中荣获第一。
引用
@article{arxiv.2101.02919,
title = {A Four-Stage Data Augmentation Approach to ResNet-Conformer Based Acoustic Modeling for Sound Event Localization and Detection},
author = {Qing Wang and Jun Du and Hua-Xin Wu and Jia Pan and Feng Ma and Chin-Hui Lee},
journal= {arXiv preprint arXiv:2101.02919},
year = {2023}
}
备注
13 pages, 8 figures, Accepted by Transactions on Audio, Speech and Language Processing