你只需听一次:一种类 YOLO 的音频分割与声音事件检测算法
音频与语音处理
2022-09-20 v3 机器学习
声音
摘要
音频分割与声音事件检测是机器听觉中的关键课题,旨在检测声学类别及其各自边界。它对于音频内容分析、语音识别、音频索引和音乐信息检索十分有用。近年来,多数研究论文采用逐类分割(segmentation-by-classification)技术。该技术将音频划分为小帧,并对这些帧逐一进行分类。本文提出一种称为 You Only Hear Once (YOHO) 的新方法,其灵感来自计算机视觉中广泛采用的 YOLO 算法。我们将声学边界的检测转化为回归问题,而非基于帧的分类。这是通过设立独立的输出神经元来检测音频类别的存在并预测其起止点实现的。在多个音频分割与声音事件检测数据集上,YOHO 的 F-measure 相对于最先进的卷积循环神经网络(Convolutional Recurrent Neural Network)的相对提升为 1% 至 6%。由于 YOHO 的输出更具端到端特性且需预测的神经元更少,其推理速度至少比逐类分割快 6 倍。此外,由于该方法直接预测声学边界,后处理与平滑速度约快 7 倍。
引用
@article{arxiv.2109.00962,
title = {You Only Hear Once: A YOLO-like Algorithm for Audio Segmentation and Sound Event Detection},
author = {Satvik Venkatesh and David Moffat and Eduardo Reck Miranda},
journal= {arXiv preprint arXiv:2109.00962},
year = {2022}
}
备注
19 pages, 4 figures, 8 tables. Added more experimental validation and background information. Published in Applied Sciences