基于分层深度神经网络的音频概念分类
音频与语音处理
2017-10-13 v1 声音
摘要
基于音频的多媒体检索任务可以识别音频流中的语义信息,即音频概念(如音乐、笑声或引擎轰鸣声)。传统的高斯混合模型在分类精简的音频概念集合上取得了一定成功。然而,多类分类可从上下文窗口分析以及更深架构的判别能力中受益。尽管深度学习在语音和物体识别等各种应用中展现出前景,但在诸如音频概念分类的其他领域尚未达到预期。本文首次探索了深度学习在用户生成内容视频中分类音频概念的潜力。所提出的系统由两个级联神经网络以分层配置构成,以分析短期和长期上下文信息。我们的系统在TRECVID-MED数据库上相对GMM方法提升54%,相对神经网络提升33%,相对深度神经网络提升12%。
引用
@article{arxiv.1710.04288,
title = {Audio Concept Classification with Hierarchical Deep Neural Networks},
author = {Mirco Ravanelli and Benjamin Elizalde and Karl Ni and Gerald Friedland},
journal= {arXiv preprint arXiv:1710.04288},
year = {2017}
}