中文

利用卷积时-频-通道压缩激励的多通道音频声音事件检测

音频与语音处理 2019-08-06 v1 机器学习 声音

摘要

在本研究中,我们引入一种卷积时-频-通道“压缩与激励”(tfc-SE)模块,以显式建模时频域与多通道之间的相互依赖关系。tfc-SE模块由两部分组成:tf-SE块与c-SE块,分别旨在对时频与通道域提供注意力,以自适应地重标定输入特征图。所提出的tfc-SE模块与一种流行的卷积循环神经网络(CRNN)模型,在具有重叠音频源的多通道声音事件检测任务上评估:训练与测试数据为用麦克风阵列录制的合成TUT Sound Events 2018数据集。我们表明tfc-SE模块可以较小额外计算代价嵌入CRNN模型,并带来声音事件检测准确率的显著提升。我们还通过分析可能影响SE块性能的各种因素进行详细消融研究。我们表明采用最佳tfc-SE块时,错误率(ER)由0.2538降至0.2026,相对降低20.17%,且F1分数提升5.72%。结果表明,经tfc-SE模块学习的声学嵌入有效增强了时频与通道方向的特征表示,从而改善判别性能。

关键词

引用

@article{arxiv.1908.01399,
  title  = {Sound Event Detection in Multichannel Audio using Convolutional Time-Frequency-Channel Squeeze and Excitation},
  author = {Wei Xia and Kazuhito Koishida},
  journal= {arXiv preprint arXiv:1908.01399},
  year   = {2019}
}

备注

Accepted by Interspeech 2019