中文

一种用于学习原始波形音频表示的多头相关性加权框架

音频与语音处理 2021-08-02 v1 声音 信号处理

摘要

在这项工作中,我们提出了一种多头相关性加权框架,用于从原始波形中学习音频表示。音频波形被分割为短时长窗口,由余弦调制高斯滤波器的1-D卷积层作为可学习滤波器组进行处理。所提框架的关键新颖之处在于在学到的滤波器组表示上引入了多头相关性。相关性网络的每个头被建模为一个独立的子网络。这些头通过对参数化声学滤波器组层学到的时间-频率表示的不同部分生成权重掩码来进行表示增强。相关性加权后的表示被输入一个神经分类器,整个系统针对音频分类目标进行联合训练。实验在DCASE2020 Task 1A挑战赛以及城市声音分类(USC)任务上进行。在这些实验中,相较于mel谱基线,所提方法在DCASE2020和USC数据集上分别取得了10%和23%的相对提升。此外,对多头相关性权重的分析提供了关于所学表示的洞见。

关键词

引用

@article{arxiv.2107.14793,
  title  = {A Multi-Head Relevance Weighting Framework For Learning Raw Waveform Audio Representations},
  author = {Debottam Dutta and Purvi Agrawal and Sriram Ganapathy},
  journal= {arXiv preprint arXiv:2107.14793},
  year   = {2021}
}

备注

Submitted to 2021 IEEE Workshop on Applications of Signal Processing to Audio and Acoustics(WASPAA 2021)