广播媒体的自动类型与节目识别
多媒体
2016-06-13 v1 计算与语言
信息检索
摘要
海量数字视频每天都在产生和播出,导致巨大的媒体档案。需要有效技术使这些数据可访问。广播媒体的自动元数据标注是多媒体索引的一项基本任务,其中使用多模态输入是标准做法。本文描述了一种利用声学特征、文本特征或两者组合自动检测媒体类型和节目身份的新方法。此外,显示可用元数据(如播出时间)的加入带来了非常高的性能。Latent Dirichlet Allocation用于建模声学和文本,产生媒体录音的固定维度表示,然后可用于基于Support Vector Machines的分类。实验在来自British Broadcasting Corporation (BBC)的超过1200小时电视广播上进行,任务是将广播分类为8种类型或133个节目身份。在200小时测试集上,使用声学和文本特征与元数据的组合,分别实现了98.6%和85.7%的类型和节目识别准确率。
引用
@article{arxiv.1606.03333,
title = {Automatic Genre and Show Identification of Broadcast Media},
author = {Mortaza Doulaty and Oscar Saz and Raymond W. M. Ng and Thomas Hain},
journal= {arXiv preprint arXiv:1606.03333},
year = {2016}
}
备注
Proc. of 17th Interspeech (2016), San Francisco, California, USA