利用卷积神经网络从弱标注音频中进行知识迁移以用于声音事件与场景
声音
2018-09-10 v4 多媒体
音频与语音处理
摘要
在这项工作中,我们提出有效从弱标注网络音频数据迁移知识的方法。我们首先描述一个基于卷积神经网络(CNN)的框架,利用弱标注音频数据进行声音事件检测与分类。我们的模型可高效地从变长音频中训练,因此非常适合迁移学习。随后我们提出使用该模型学习表示的方法,这些表示可有效用于解决目标任务。我们研究了直推式与归纳式迁移学习任务,展示了我们的方法在域适应和任务适应上的有效性。我们表明,使用所提 CNN 模型学习的表示泛化性足够好,在 ESC-50 声音事件数据集上达到人类水平准确率,并在该数据集上确立了当前最优结果。我们进一步将其用于声学场景分类任务,并再次表明我们所提方法同样适用于该任务。我们还表明我们的方法有助于捕捉语义含义与关系。此外,在此过程中我们依靠平衡训练集在 Audioset 数据集上也确立了当前最优结果。
引用
@article{arxiv.1711.01369,
title = {Knowledge Transfer from Weakly Labeled Audio using Convolutional Neural Network for Sound Events and Scenes},
author = {Anurag Kumar and Maksim Khadkevich and Christian Fugen},
journal= {arXiv preprint arXiv:1711.01369},
year = {2018}
}
备注
ICASSP 2018