用于构音障碍语音检测与重建的可解释深度学习模型
音频与语音处理
2019-07-11 v1 计算与语言
声音
摘要
本文提出了一种用于构音障碍语音检测与重建的新方法。编码器-解码器模型将语音分解为低维潜在空间与输入文本的编码。我们表明该潜在空间传达了构音障碍的可解释特征,如语音的可懂度与流畅度。MUSHRA 感知测试表明,对潜在空间的调整使模型生成流畅度改善的语音。用于同时预测构音障碍语音概率与 mel 谱图的多任务监督方法借助自动编码器的低维潜在空间(而非直接从高维 mel 谱图预测构音障碍),提升了构音障碍检测的准确性。
引用
@article{arxiv.1907.04743,
title = {Interpretable Deep Learning Model for the Detection and Reconstruction of Dysarthric Speech},
author = {Daniel Korzekwa and Roberto Barra-Chicote and Bozena Kostek and Thomas Drugman and Mateusz Lajszczak},
journal= {arXiv preprint arXiv:1907.04743},
year = {2019}
}
备注
5 pages, 5 figures, Accepted for Interspeech 2019