在声学场景分类中利用深度架构捕获分散的判别信息
音频与语音处理
2020-07-10 v1 机器学习
声音
摘要
在声学场景分类(ASC)中,经常存在一些共享许多共同声学特性且容易被误分类的类对。为了区分这些类对,分散在整个数据中的细微细节可能是至关重要的线索。然而,这些细节不太引人注意,且很容易被传统的非线性激活函数(如 ReLU)移除。此外,如果系统没有得到充分泛化,强调细微细节的设计选择很容易导致过拟合。在本研究中,基于对 ASC 任务特性的分析,我们研究了各种捕获判别信息并同时缓解过拟合问题的方法。我们采用最大特征图方法来替代深度神经网络中传统的非线性激活函数,从而在卷积层输出的不同滤波器之间应用逐元素比较。我们进一步探索了两种数据增强方法和两种深度架构模块,以减少过拟合并维持系统的判别能力。使用声学场景和事件检测与分类 2020 任务 1-a 数据集进行了各种实验,以验证所提方法。结果表明,所提系统始终优于基线,其中表现最佳的单系统准确率达到 70.4%,而基线为 65.1%。
引用
@article{arxiv.2007.04631,
title = {Capturing scattered discriminative information using a deep architecture in acoustic scene classification},
author = {Hye-jin Shim and Jee-weon Jung and Ju-ho Kim and Ha-jin Yu},
journal= {arXiv preprint arXiv:2007.04631},
year = {2020}
}
备注
Submitted to DCASE2020 workshop