中文

基于深度学习的构音障碍语音检测中 STFT 相位表示的实验研究

音频与语音处理 2022-01-25 v2

摘要

主流的基于深度学习的构音障碍语音检测方法通常依赖于处理输入信号的短时傅里叶变换幅度谱,而忽略相位谱。尽管从幅度谱可获得关于信号结构的相当多信息,相位谱也包含因相位不连续而不易察觉的固有结构。为揭示有意义的相位结构,若干应用已研究如修正群延迟(MGD)与瞬时频率(IF)谱等替代相位表示。本文旨在研究未处理相位、MGD 与 IF 谱在构音障碍语音检测中的适用性。实验结果表明,所有考虑的相位表示中均存在构音障碍线索。进一步表明,将相位表示作为幅度谱的互补特征有益于基于深度学习的构音障碍语音检测,其中幅度与 IF 谱的组合取得了高性能。所呈现结果应提高研究界对相位谱用于构音障碍语音检测潜力的认识,并激励研究最优利用幅度与相位信息的新架构。

关键词

引用

@article{arxiv.2110.03283,
  title  = {Experimental investigation on STFT phase representations for deep learning-based dysarthric speech detection},
  author = {Parvaneh Janbakhshi and Ina Kodrasi},
  journal= {arXiv preprint arXiv:2110.03283},
  year   = {2022}
}

备注

Accepted in ICASSP 2022