中文

音频分类中多特征选择与集成的研究

声音 2022-06-16 v1 机器学习 音频与语音处理

摘要

深度学习(DL)算法在多个领域展现出令人印象深刻的性能。其中,音频因一些有趣的模式——尤其在音频数据分类方面——在过去几十年吸引了众多研究者。为提升音频分类性能,特征选择与组合起着关键作用,因其可能成就或破坏任何DL模型的性能。为探究此作用,我们对若干前沿DL模型(即卷积神经网络、EfficientNet、MobileNet、支持向量机与多层感知机)配合各类先进音频特征(即梅尔谱图、梅尔频率倒谱系数与过零率)独立使用或组合使用(即通过集成)在三个不同数据集(即Free Spoken Digits Dataset、Audio Urdu Digits Dataset与Audio Gujarati Digits Dataset)上的性能进行了广泛评估。总体而言,结果表明特征选择取决于数据集与模型两者。然而,特征组合应仅限于那些单独使用时已能取得良好性能的特征(即多为梅尔谱图、梅尔频率倒谱系数)。此类特征组合/集成使我们无论选择何种DL模型均能超越以往的SOTA结果。

关键词

引用

@article{arxiv.2206.07511,
  title  = {Investigating Multi-Feature Selection and Ensembling for Audio Classification},
  author = {Muhammad Turab and Teerath Kumar and Malika Bendechache and Takfarinas Saber},
  journal= {arXiv preprint arXiv:2206.07511},
  year   = {2022}
}