中文

不同通道输入的 CNN 深度分析用于声学场景分类

声音 2021-08-16 v4 机器学习 音频与语音处理

摘要

近年来,声学场景分类(ASC)已使用卷积神经网络或循环神经网络等深度学习技术进行处理。许多最先进的解决方案基于图像分类框架,因此,训练这些网络时考虑音频信号的二维表示。寻找最合适的音频表示仍然是一个值得关注的研究领域。本文分析了对数梅尔表示的不同形式及其组合。实验表明,使用谐波和打击乐成分加上左右立体声通道之差(L-R)可获得最佳结果。另一方面,集成不同模型以提高最终准确率是一种常见策略。尽管对不同模型预测取平均是常见选择,但在 ASC 问题中尚未对不同的集成技术进行详尽分析。本文研究了几何平均、算术平均以及有序加权平均(OWA)算子作为集成中不同模型输出的聚合算子。最后,本文开展的工作高度面向实时实现。在此背景下,随着边缘设备上音频分类应用数量呈指数级增长,我们还分析了不同的网络深度以及用于聚合集成预测的高效解决方案。

关键词

引用

@article{arxiv.1906.04591,
  title  = {CNN depth analysis with different channel inputs for Acoustic Scene Classification},
  author = {Sergi Perez-Castanos and Javier Naranjo-Alcazar and Pedro Zuccarello and Maximo Cobos and Frances J. Ferri},
  journal= {arXiv preprint arXiv:1906.04591},
  year   = {2021}
}

备注

Accepted at URSI 2020, Malaga, Spain