用于声学场景分类的深度神经决策森林
音频与语音处理
2022-03-08 v1 人工智能
机器学习
声音
摘要
声学场景分类(ASC)旨在根据录音环境的特征对音频片段进行分类。在这方面,基于深度学习的方法已成为解决 ASC 问题的有用工具。提高分类精度的常规方法包括集成注意力机制、预训练模型以及集成多个子网络等辅助方法。然而,由于从不同环境捕获的音频片段的复杂性,对于仅使用单一分类器的现有深度学习模型,若不使用任何辅助方法则难以区分其类别。本文提出一种使用深度神经决策森林(DNDF)的 ASC 新方法。DNDF 结合了固定数量的卷积层与作为最终分类器的决策森林。该决策森林由固定数量的决策树分类器组成,已在某些数据集上展现出优于单一分类器的分类性能。特别地,该决策森林与传统随机森林有本质不同,它是随机的、可微分的,并能够利用反向传播来更新和学习神经网络中的特征表示。在 DCASE2019 与 ESC-50 数据集上的实验结果表明,我们所提出的 DNDF 方法在分类精度方面提升了 ASC 性能,并与最先进的基线方法相比具有竞争力。
引用
@article{arxiv.2203.03436,
title = {Deep Neural Decision Forest for Acoustic Scene Classification},
author = {Jianyuan Sun and Xubo Liu and Xinhao Mei and Jinzheng Zhao and Mark D. Plumbley and Volkan Kılıç and Wenwu Wang},
journal= {arXiv preprint arXiv:2203.03436},
year = {2022}
}
备注
Submitted to the 30th European Signal Processing Conference (EUSIPCO), 5 pages, 2 figures