网络视频中声音事件检测评估框架
声音
2018-04-05 v2 人工智能
信息检索
音频与语音处理
摘要
声音事件最大的来源是网络视频。大多数视频缺乏片段级的声音事件标签,然而,其中有相当数量的视频确实会对文本查询作出响应,这是由搜索引擎利用元数据匹配所发现的。在本文中,我们探究在多大程度上可将搜索查询用作视频中声音事件检测的真实标签。我们提出了一个用于网络视频大规模声音事件识别的框架。该框架使用对应于来自三个数据集的 78 个声音事件标签的搜索查询爬取视频。这些数据集用于训练三个分类器,我们在 370 万个网络视频片段上获得了预测结果。我们使用搜索查询作为真实标签评估性能,并将其与人工标注进行比较。两类真值表现出接近的性能,差距在 10% 以内,并且随着评估片段数量的增加呈现相似的性能趋势。因此,我们的实验显示了将搜索查询用作网络视频中声音事件识别的初步真实标签的潜力。
引用
@article{arxiv.1711.00804,
title = {Framework for evaluation of sound event detection in web videos},
author = {Rohan Badlani and Ankit Shah and Benjamin Elizalde and Anurag Kumar and Bhiksha Raj},
journal= {arXiv preprint arXiv:1711.00804},
year = {2018}
}
备注
Camera Ready Version of Paper accepted at International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2018. First two Authors - Rohan Badlani and Ankit Shah contributed equally