基于音频的BBC电视节目分类深度学习框架
声音
2022-02-14 v2 音频与语音处理
摘要
本文提出一种利用音频对BBC电视节目进行分类的深度学习框架。首先将音频转换为频谱图,输入预训练的卷积神经网络(CNN),获得音频记录中发声事件发生的预测概率。随后计算预测概率与检测到的发声事件的统计量,以提取表征电视节目的判别性特征。最后,将提取的嵌入特征输入分类器,把节目归类至不同体裁。我们的实验在由BBC标注的9类共6,160个节目数据集上进行,通过14折交叉验证取得平均分类准确率93.7%。这证明了所提框架在基于音频的电视节目分类任务中的有效性。
引用
@article{arxiv.2104.01161,
title = {An Audio-Based Deep Learning Framework For BBC Television Programme Classification},
author = {Lam Pham and Chris Baume and Qiuqiang Kong and Tassadaq Hussain and Wenwu Wang and Mark Plumbley},
journal= {arXiv preprint arXiv:2104.01161},
year = {2022}
}