中文

基于扩展因子化分层变分自编码器的语音障碍分类

音频与语音处理 2021-06-15 v1

摘要

针对存在沟通困难的说话人开展客观的语音障碍分类,对于诊断与实施治疗十分必要。在当前语音技术状况下,采用神经网络用于该应用已是显而易见。但神经网络模型训练受限于缺乏标注的障碍语音数据。本研究将扩展版因子化分层变分自编码器(FHVAE)应用于障碍语音的表示学习。FHVAE模型从语音数据中提取与内容相关及与序列相关的潜变量,我们利用所提取的变量探究障碍类型信息如何在潜变量中表示。为获得更好的分类性能,潜变量在词与句子层级进行聚合。我们表明,FHVAE模型的扩展版成功实现了内容相关与序列相关表示更好的解耦,但两类表示对于障碍类型分类的最佳结果仍均为必需。

关键词

引用

@article{arxiv.2106.07337,
  title  = {Speech Disorder Classification Using Extended Factorized Hierarchical Variational Auto-encoders},
  author = {Jinzi Qi and Hugo Van hamme},
  journal= {arXiv preprint arXiv:2106.07337},
  year   = {2021}
}

备注

5 pages, 2 figures, submitted to INTERSPEECH2021