中文

基于注意力卷积神经网络融合的声学场景分类用于DCASE2019挑战赛

音频与语音处理 2019-07-17 v1 声音

摘要

本报告描述了布尔诺理工大学(BUT)团队在DCASE-2019挑战赛任务1(声学场景分类,ASC)中的提交方案,并提供了对不同方法的分析。所提出的方法是对三种不同卷积神经网络(CNN)拓扑结构的融合。第一种是类似VGG的二维CNN。第二种同样是一个二维CNN网络,其使用最大特征图(Max-Feature-Map)激活函数,称为轻量CNN(LCNN)。第三种网络是一维CNN,主要用于说话人验证,称为x-vector拓扑。所有提出的网络均使用自注意力机制进行统计池化。我们使用256维对数梅尔谱图作为特征。我们的提交方案是在使用不同融合策略生成的4折评估设置上训练的多个网络的融合。

关键词

引用

@article{arxiv.1907.07127,
  title  = {Acoustic Scene Classification Using Fusion of Attentive Convolutional Neural Networks for DCASE2019 Challenge},
  author = {Hossein Zeinali and Lukáš Burget and Jan "Honza'' Černocký},
  journal= {arXiv preprint arXiv:1907.07127},
  year   = {2019}
}

备注

arXiv admin note: text overlap with arXiv:1810.04273