中文

利用弱标注网络数据的音频事件识别深度 CNN 框架

声音 2022-10-04 v3 机器学习 多媒体

摘要

音频事件识别系统的开发需要标注的训练数据,而这些数据通常难以获取。网络上海量的多媒体数据是音频事件录音的一个有希望的来源。特别是,如果必须对网络音频本身进行音频内容分析,那么利用此类数据训练识别器本身就显得尤为重要。然而,利用这些网络数据进行训练面临若干挑战,其中最重要的是标签的可用性:即使能获得数据的标签,它们通常也是弱标签,而非训练检测器或分类器通常所需的那种标签。我们提出,能够利用弱标签的学习算法提供了一种从网络数据中学习的有效方法。随后,我们提出了一种基于深度卷积神经网络 (CNN) 的鲁棒且高效的框架,用于从弱标注数据中学习音频事件识别器。所提出的方法能够以高效的方式训练和分析可变长度的录音,其性能显著优于使用强标注网络数据训练的神经网络。此外,尽管我们是从弱标注数据中学习(训练期间无法获取录音内的事件时间戳),但所提出的框架能够在推理阶段对事件进行定位。

关键词

引用

@article{arxiv.1707.02530,
  title  = {Deep CNN Framework for Audio Event Recognition using Weakly Labeled Web Data},
  author = {Anurag Kumar and Bhiksha Raj},
  journal= {arXiv preprint arXiv:1707.02530},
  year   = {2022}
}