中文

一种用于弱标注数据音频标记的联合检测-分类模型

声音 2019-12-10 v1

摘要

音频标记旨在为一个音频片段分配一个或多个标签。大多数数据集是弱标注的,这意味着仅知道片段的标签,而不知道标签的出现时间。音频片段的标注通常基于片段中的音频事件,且不向用户提供事件级别的标签。以往的工作使用帧袋模型,假设标签始终出现,但这在实际中并非如此。我们提出了一种联合检测-分类 (JDC) 模型,以同时检测和分类音频片段。JDC 模型能够关注信息性声音并忽略非信息性声音。然后仅使用信息性区域进行分类。在“CHiME Home”数据集上的实验结果表明,JDC 模型将等错误率 (EER) 从 19.0% 降至 16.9%。更有趣的是,音频事件检测器在不需要事件级别标签的情况下被成功训练。

关键词

引用

@article{arxiv.1610.01797,
  title  = {A Joint Detection-Classification Model for Audio Tagging of Weakly Labelled Data},
  author = {Qiuqiang Kong and Yong Xu and Wenwu Wang and Mark Plumbley},
  journal= {arXiv preprint arXiv:1610.01797},
  year   = {2019}
}

备注

Submitted to ICASSP 2017