中文

采用时序标注数据与连接时序分类模型的音频标注

声音 2018-08-07 v1 计算与语言 音频与语音处理

摘要

音频标注旨在预测一段音频片段中的一个或多个标签。许多先前工作使用弱标注数据 (WLD) 进行音频标注,其中仅知声音事件的存在与否,但声音事件的顺序未知。为利用声音事件的顺序信息,我们提出时序标注数据 (SLD),其中声音事件的存在与否及顺序信息均已知。为在音频标注中利用 SLD,我们提出一种卷积循环神经网络后接连接时序分类 (CRNN-CTC) 目标函数,以将音频片段频谱图映射至 SLD。实验表明,CRNN-CTC 在音频标注中获得 0.986 的曲线下面积 (AUC) 分数,优于基线 CRNN 的 0.908 与分别采用最大池化和平均池化的 0.815。此外,我们展示 CRNN-CTC 具备预测音频片段中声音事件顺序的能力。

关键词

引用

@article{arxiv.1808.01935,
  title  = {Audio Tagging With Connectionist Temporal Classification Model Using Sequential Labelled Data},
  author = {Yuanbo Hou and Qiuqiang Kong and Shengchen Li},
  journal= {arXiv preprint arXiv:1808.01935},
  year   = {2018}
}