基于松弛实例频域归一化的域泛化方法用于多设备声学场景分类
声音
2022-06-28 v1 机器学习
音频与语音处理
摘要
在图像处理中使用二维卷积神经网络(2D-CNN)时,可利用通道统计量操控域信息,且实例归一化已成为获取域不变特征的一种有前景的方法。然而,与图像处理不同,我们分析得出音频特征中与域相关的信息在频率统计量而非通道统计量中占主导。受我们的分析启发,我们引入了松弛实例频域归一化(RFN):一种即插即用的、沿频率轴的显式归一化模块,其可消除音频特征中实例特定的域差异,同时放宽对有用判别信息的不必要损失。经验上,仅将 RFN 添加到网络中,相较于先前的声学场景分类域泛化方法便显示出明显优势,并对多种音频设备提升了鲁棒性。特别地,所提出的 RFN 以明显优势赢得了 DCASE2021 挑战赛任务1A(多设备低复杂度声学场景分类),且 RFN 是我们技术报告的扩展工作。
引用
@article{arxiv.2206.12513,
title = {Domain Generalization with Relaxed Instance Frequency-wise Normalization for Multi-device Acoustic Scene Classification},
author = {Byeonggeun Kim and Seunghan Yang and Jangho Kim and Hyunsin Park and Juntae Lee and Simyung Chang},
journal= {arXiv preprint arXiv:2206.12513},
year = {2022}
}
备注
Proceedings of INTERSPEECH 2022