结合多通道I-Vector与卷积神经网络的混合方法用于声学场景分类
声音
2017-11-15 v1 人工智能
机器学习
摘要
在声学场景分类(ASC)中,主要有两种方法被遵循。一种利用人工设计的特征,如梅尔频率倒谱系数(MFCCs);另一种使用作为优化算法结果的学习特征。I-vector是一种建模技术的结果,通常以人工设计的特征作为输入。已有研究表明,从单声道音频信号提取的标准MFCCs所得到的I-vector性能较差,尤其在室内声学场景中。同时,卷积神经网络(CNNs)以其通过优化滤波器学习特征的能力而闻名。它们已被应用于ASC并展现出有前景的结果。本文首先提出一种新颖的多通道I-vector提取与评分方案用于ASC,提升了其在室内外场景上的性能。其次,我们提出一种CNN架构,取得了有前景的ASC结果。进一步,我们表明I-vector与CNN从声学场景中捕获互补信息。最后,我们提出一种利用分数融合技术结合多通道I-vector与CNN的混合ASC系统。使用该方法,我们参加了DCASE-2016挑战赛的ASC任务。我们的混合方法在49份提交中排名第一,显著提升了此前的最优水平。
引用
@article{arxiv.1706.06525,
title = {A Hybrid Approach with Multi-channel I-Vectors and Convolutional Neural Networks for Acoustic Scene Classification},
author = {Hamid Eghbal-zadeh and Bernhard Lehner and Matthias Dorfer and Gerhard Widmer},
journal= {arXiv preprint arXiv:1706.06525},
year = {2017}
}