DCAR:一种用于改进事件检测的判别式紧凑音频表示
声音
2016-07-18 v1 多媒体
摘要
本文提出了一种新颖的两阶段音频表示方法——判别式紧凑音频表示(DCAR),并评估了其在消费者制作视频中检测事件的性能。在DCAR的第一阶段,每个音轨使用高斯混合模型(GMM)建模,该模型包含多个分量以捕捉该音轨内的变异性。第二阶段同时考虑全局结构和局部结构。在此阶段,通过在格拉斯曼流形上构造一个优化问题,使分量更具判别性和紧凑性,我们发现这能有效表示音频的结构。我们的实验使用了YLI-MED数据集(一个基于YFCC100M的开放TRECVID风格视频语料库),其中包含十个事件。结果表明,所提出的DCAR表示始终优于最先进的音频表示。DCAR相对于i-vector、mv-vector和GMM表示的优势,在较易和较难的判别任务中均很显著。我们讨论了这些在不同难度案例上的性能差异如何源于每种模型利用(或未利用)数据内在结构的方式。此外,DCAR在人类更难分类视频的事件上,即标注者平均置信度较低的事件上,显示出尤为显著的准确率优势。
引用
@article{arxiv.1607.04378,
title = {DCAR: A Discriminative and Compact Audio Representation to Improve Event Detection},
author = {Liping Jing and Bo Liu and Jaeyoung Choi and Adam Janin and Julia Bernd and Michael W. Mahoney and Gerald Friedland},
journal= {arXiv preprint arXiv:1607.04378},
year = {2016}
}
备注
An abbreviated version of this paper will be published in ACM Multimedia 2016