中文

SpeechYOLO:语音对象的检测与定位

音频与语音处理 2019-09-26 v2 机器学习 声音 机器学习

摘要

在本文中,我们提出将视觉领域的目标检测方法应用于语音识别领域,将音频片段视为对象。更具体地,我们提出了 SpeechYOLO,其受用于图像中目标检测的 YOLO 算法启发。SpeechYOLO 的目标是在输入信号中定位语句的边界,并正确地对它们进行分类。我们的系统由一个卷积神经网络组成,带有简单的均方损失函数。我们在多个关键词 spotting 任务上评估了该系统,包括朗读语音和自发语音语料库。我们的系统在与专为定位和分类训练的其他算法的比较中表现优越。

关键词

引用

@article{arxiv.1904.07704,
  title  = {SpeechYOLO: Detection and Localization of Speech Objects},
  author = {Yael Segal and Tzeviya Sylvia Fuchs and Joseph Keshet},
  journal= {arXiv preprint arXiv:1904.07704},
  year   = {2019}
}