使用深度学习进行嗓音病理检测:一项初步研究
音频与语音处理
2019-07-16 v1 机器学习
声音
摘要
本文描述了使用深度神经网络进行嗓音病理检测的初步研究。我们使用了来自德国 Saarbruecken Voice Database (SVD) 语料库中以正常音高发出的持续元音 /a/ 的录音。该语料库包含 2000 多名说话者的语音录音和声门电图信号。本实验的思路是将卷积层与循环长短期记忆(LSTM)层结合应用于原始音频信号。每条录音被分割为 64 ms 的汉明窗片段,重叠 30 ms。我们训练的模型在 206 个验证文件上达到了 71.36% 的准确率、65.04% 的敏感性和 77.67% 的特异性,在 874 个测试文件上达到了 68.08% 的准确率、66.75% 的敏感性和 77.89% 的特异性。这是一个支持该方法的令人鼓舞的结果,因为其表现与以往使用不同方法学发表的类似实验相当。要达到 SOTA 结果,仍需进一步研究。
引用
@article{arxiv.1907.05905,
title = {Voice Pathology Detection Using Deep Learning: a Preliminary Study},
author = {Pavol Harar and Jesus B. Alonso-Hernandez and Jiri Mekyska and Zoltan Galaz and Radim Burget and Zdenek Smekal},
journal= {arXiv preprint arXiv:1907.05905},
year = {2019}
}
备注
4 pages, 1 figure, 5 tables