基于注意力多通道深度架构的声学特征融合
声音
2018-11-05 v1 音频与语音处理
摘要
本文提出一种用于音频分类任务的新颖深度融合架构。所提出的多通道模型由深度卷积层构成,不同声学特征分别通过各通道传入。为实现跨通道的信息传播,我们引入注意力特征图以辅助帧对齐。各通道的输出通过使用非线性聚合代表性特征的交互参数进行合并。最后,我们在三个基准数据集上评估所提架构的性能:DCASE-2016与LITIS Rouen(声学场景识别)以及CHiME-Home(标注)。实验结果表明,所提架构优于标准基线,并在声学场景识别与音频标注任务上取得了出色性能。
引用
@article{arxiv.1811.00936,
title = {Acoustic Features Fusion using Attentive Multi-channel Deep Architecture},
author = {Gaurav Bhatt and Akshita Gupta and Aditya Arora and Balasubramanian Raman},
journal= {arXiv preprint arXiv:1811.00936},
year = {2018}
}
备注
Accepted in CHiME'18 (Interspeech Workshop)