超越等长片段:识别音频场景需要多长时长?
声音
2019-05-10 v2 机器学习
音频与语音处理
摘要
由于音频场景特征的差异性,某些场景自然可比其他场景更早被识别。在这项工作中,我们不像文献中常见的那样对所有场景类别使用等长片段,而是研究在给定最先进模型的情况下,音频场景在多长时间范围内可被可靠识别。此外,由于深度网络集成的模型融合在音频场景分类中十分普遍,我们进一步研究对于该任务而言模型融合是否必要、若必要则在何时必要。为实现这些目标,我们采用了两个基于卷积神经网络和循环神经网络的单网络系统进行分类,并对这些网络进行早期融合与晚期融合。在LITIS-Rouen数据集上的实验结果表明,某些场景仅需几秒即可可靠识别,而其他场景则需要显著更长的时长。此外,模型融合在信号长度较短时收益最为明显。
引用
@article{arxiv.1811.01095,
title = {Beyond Equal-Length Snippets: How Long is Sufficient to Recognize an Audio Scene?},
author = {Huy Phan and Oliver Y. Chén and Philipp Koch and Lam Pham and Ian McLoughlin and Alfred Mertins and Maarten De Vos},
journal= {arXiv preprint arXiv:1811.01095},
year = {2019}
}
备注
Accepted to 2019 AES Conference on Audio Forensics