中文

利用带可学习门控线性单元的CRNN与序列标注数据进行复音音频标注

声音 2018-11-20 v1 音频与语音处理

摘要

音频标注旨在检测录音中发生的声音事件类型。为对复音音频录音进行标注,我们提出在卷积循环神经网络(CRNN)之上使用连接时序分类(CTC)损失函数并结合可学习门控线性单元(GLU-CTC),该方法基于一种新型音频标签数据:序列标注数据(SLD)。在GLU-CTC中,CTC目标函数将标签的帧级概率映射为标签的片段级概率。为比较GLU-CTC对声音事件的映射能力,我们训练了基于全局最大池化(GLU-GMP)的带GLU的CRNN和基于全局平均池化(GLU-GAP)的带GLU的CRNN。我们还将该GLU-CTC系统与基线系统进行比较,基线系统为不使用GLU、采用CTC损失函数训练的CRNN。实验表明,GLU-CTC在音频标注中取得了0.882的曲线下面积(AUC)分数,优于GLU-GMP的0.803、GLU-GAP的0.766以及基线系统的0.837。这意味着在相同的带GLU的CRNN模型下,CTC映射的性能优于GMP和GAP映射。在同样基于CTC映射的情况下,带GLU的CRNN优于不带GLU的CRNN。

关键词

引用

@article{arxiv.1811.07072,
  title  = {Polyphonic audio tagging with sequentially labelled data using CRNN with learnable gated linear units},
  author = {Yuanbo Hou and Qiuqiang Kong and Jun Wang and Shengchen Li},
  journal= {arXiv preprint arXiv:1811.07072},
  year   = {2018}
}

备注

DCASE2018 Workshop. arXiv admin note: text overlap with arXiv:1808.01935