面向真实场景声音事件定位与检测的多维数据增强与挤压激励网络
音频与语音处理
2022-06-27 v1 声音
摘要
由于难以获取足够数量带有精确标注的真实多通道音频数据录音,真实场景中声音事件定位与检测(SELD)的性能受到 SELD 数据集规模较小的限制。我们采用两种主要策略来解决真实小规模 SELD 数据集带来的问题。首先,我们在所有数据维度(通道、频率和时间)上应用了多种数据增强方法。我们还提出了一种名为 Moderate Mixup 的原创数据增强方法,以模拟存在噪声基底或干扰事件的情况。其次,我们在通道和频率维度上应用挤压激励(Squeeze-and-Excitation)模块,以高效提取特征特性。我们训练的模型在 STARSS22 测试数据集上的结果分别取得了最佳的 ER、F1、LE 和 LR:0.53、49.8%、16.0deg. 和 56.2%。
引用
@article{arxiv.2206.12059,
title = {Data Augmentation and Squeeze-and-Excitation Network on Multiple Dimension for Sound Event Localization and Detection in Real Scenes},
author = {Byeong-Yun Ko and Hyeonuk Nam and Seong-Hu Kim and Deokki Min and Seung-Deok Choi and Yong-Hwa Park},
journal= {arXiv preprint arXiv:2206.12059},
year = {2022}
}
备注
Technical Report submitted for DCASE2022 Challenge Task3