中文

基于音频的BBC电视节目分类深度学习框架

声音 2022-02-14 v2 音频与语音处理

摘要

本文提出一种利用音频对BBC电视节目进行分类的深度学习框架。首先将音频转换为频谱图,输入预训练的卷积神经网络(CNN),获得音频记录中发声事件发生的预测概率。随后计算预测概率与检测到的发声事件的统计量,以提取表征电视节目的判别性特征。最后,将提取的嵌入特征输入分类器,把节目归类至不同体裁。我们的实验在由BBC标注的9类共6,160个节目数据集上进行,通过14折交叉验证取得平均分类准确率93.7%。这证明了所提框架在基于音频的电视节目分类任务中的有效性。

关键词

引用

@article{arxiv.2104.01161,
  title  = {An Audio-Based Deep Learning Framework For BBC Television Programme Classification},
  author = {Lam Pham and Chris Baume and Qiuqiang Kong and Tassadaq Hussain and Wenwu Wang and Mark Plumbley},
  journal= {arXiv preprint arXiv:2104.01161},
  year   = {2022}
}