利用语义声学特征识别 Flickr 视频所属城市
多媒体
2016-07-13 v1 计算机视觉与模式识别
声音
摘要
视频的城市识别旨在确定一段视频属于一组城市的可能性。本文提出一种仅使用音频的方法,因此我们不使用图像、用户标签或地理标签等任何其他模态。通过这种方式,我们展示了视频的城市位置与其声学信息之间的关联程度。该任务的成功表明可以改进以补充其他模态。具体而言,我们提出了一种计算和使用语义声学特征进行城市识别的方法,且这些特征显示了识别的语义证据。该语义证据由城市声音分类体系给出,并表达了这些声音在城市音轨中的潜在存在。我们使用了 MediaEval Placing Task 数据集,其中包含按城市标注的 Flickr 视频。此外,我们还使用了 UrbanSound8K 数据集,其中包含按声音类型标注的音频片段。我们的方法提升了当前最优性能,并为该任务提供了一种新颖的语义方法。
引用
@article{arxiv.1607.03257,
title = {City-Identification of Flickr Videos Using Semantic Acoustic Features},
author = {Benjamin Elizalde and Guan-Lin Chao and Ming Zeng and Ian Lane},
journal= {arXiv preprint arXiv:1607.03257},
year = {2016}
}