用于DCASE2018声学场景分类挑战的卷积神经网络与x-vector嵌入
音频与语音处理
2018-10-11 v1 声音
摘要
本文描述了布尔诺理工大学(BUT)团队在DCASE-2018挑战任务1(声学场景分类,ASC)中的提交方案,并提供了排行榜集上不同方法的分析。所提方法是两种不同卷积神经网络(CNN)拓扑的融合。第一种是主要用于图像分类的常规二维CNN。第二种是用于提取定长音频段嵌入(即所谓x-vectors)的一维CNN,其亦用于语音处理,特别是说话人识别。除不同的拓扑外,测试了两类特征:对数梅尔谱图与CQT特征。最终,在性能最佳的系统中使用简单的输出平均融合不同系统的输出。我们的提交在ASC子任务A(任务1a)的24支队伍中排名第三。
引用
@article{arxiv.1810.04273,
title = {Convolutional Neural Networks and x-vector Embedding for DCASE2018 Acoustic Scene Classification Challenge},
author = {Hossein Zeinali and Lukas Burget and Jan Cernocky},
journal= {arXiv preprint arXiv:1810.04273},
year = {2018}
}