中文

使用深度学习进行嗓音病理检测:一项初步研究

音频与语音处理 2019-07-16 v1 机器学习 声音

摘要

本文描述了使用深度神经网络进行嗓音病理检测的初步研究。我们使用了来自德国 Saarbruecken Voice Database (SVD) 语料库中以正常音高发出的持续元音 /a/ 的录音。该语料库包含 2000 多名说话者的语音录音和声门电图信号。本实验的思路是将卷积层与循环长短期记忆(LSTM)层结合应用于原始音频信号。每条录音被分割为 64 ms 的汉明窗片段,重叠 30 ms。我们训练的模型在 206 个验证文件上达到了 71.36% 的准确率、65.04% 的敏感性和 77.67% 的特异性,在 874 个测试文件上达到了 68.08% 的准确率、66.75% 的敏感性和 77.89% 的特异性。这是一个支持该方法的令人鼓舞的结果,因为其表现与以往使用不同方法学发表的类似实验相当。要达到 SOTA 结果,仍需进一步研究。

关键词

引用

@article{arxiv.1907.05905,
  title  = {Voice Pathology Detection Using Deep Learning: a Preliminary Study},
  author = {Pavol Harar and Jesus B. Alonso-Hernandez and Jiri Mekyska and Zoltan Galaz and Radim Burget and Zdenek Smekal},
  journal= {arXiv preprint arXiv:1907.05905},
  year   = {2019}
}

备注

4 pages, 1 figure, 5 tables