SpeechYOLO:语音对象的检测与定位
音频与语音处理
2019-09-26 v2 机器学习
声音
机器学习
摘要
在本文中,我们提出将视觉领域的目标检测方法应用于语音识别领域,将音频片段视为对象。更具体地,我们提出了 SpeechYOLO,其受用于图像中目标检测的 YOLO 算法启发。SpeechYOLO 的目标是在输入信号中定位语句的边界,并正确地对它们进行分类。我们的系统由一个卷积神经网络组成,带有简单的均方损失函数。我们在多个关键词 spotting 任务上评估了该系统,包括朗读语音和自发语音语料库。我们的系统在与专为定位和分类训练的其他算法的比较中表现优越。
引用
@article{arxiv.1904.07704,
title = {SpeechYOLO: Detection and Localization of Speech Objects},
author = {Yael Segal and Tzeviya Sylvia Fuchs and Joseph Keshet},
journal= {arXiv preprint arXiv:1904.07704},
year = {2019}
}