评估 You Only Hear Once (YOHO) 算法在 VOICe 数据集含噪音频上的鲁棒性
声音
2021-11-03 v1 计算与语言
音频与语音处理
摘要
机器听觉中的声音事件检测(SED)旨在识别音频文件中的不同声音,并确定特定声音事件在音频中的起止时间。SED 用于多种应用,如音频监控、语音识别以及多媒体数据库中基于上下文的数据索引与检索。然而,在现实场景中,来自各种来源的音频很少能完全没有干扰噪声或扰动。在本文中,我们测试了 You Only Hear Once (YOHO) 算法在含噪音频数据上的性能。受计算机视觉中 You Only Look Once (YOLO) 算法的启发,YOHO 算法在 Music Speech Detection Dataset、TUT Sound Event 和 Urban-SED 等数据集上能够匹配各类最先进算法的性能,但推理时间更短。在本文中,我们探究了 YOHO 算法在 VOICe 数据集上的表现,该数据集包含具有不同信噪比(SNR)噪声的音频文件。YOHO 能够优于或至少匹配 VOICe 数据集论文中报道的性能最佳的 SED 算法,且推理耗时更短。
引用
@article{arxiv.2111.01205,
title = {Evaluating robustness of You Only Hear Once(YOHO) Algorithm on noisy audios in the VOICe Dataset},
author = {Soham Tiwari and Kshitiz Lakhotia and Manjunath Mulimani},
journal= {arXiv preprint arXiv:2111.01205},
year = {2021}
}
备注
7 pages, 1 figure, 3 tables, Efficient Natural Language and Speech Processing Workshop, NeurIPS 2021