中文

从原始语音中学习检测构音障碍

计算与语言 2019-01-09 v2

摘要

副语言特征的语音分类器传统上从多样的手工低层特征中学习,通过为当前任务选择相关信息。我们探索了一种替代该选择的方案,即联合学习分类器和特征提取。近期语音识别的工作表明,通过从波形中学习获得了优于语音特征的性能。我们将该方法扩展到副语言分类,并提出一种神经网络,能够从原始语音中联合学习滤波器组、归一化因子和压缩幂,并与架构的其余部分共同训练。我们将该模型应用于从句级音频录音中检测构音障碍。从一个强注意力基线出发(其中梅尔滤波器组优于标准低层描述符),我们展示学习滤波器或归一化与压缩相比固定特征绝对准确率提升10%。我们还观察到,通过联合学习特征提取、归一化和压缩因子与架构,相对于OpenSmile特征有增益。这构成了首次尝试从原始音频中联合学习所有这些操作以用于语音分类任务。

关键词

引用

@article{arxiv.1811.11101,
  title  = {Learning to detect dysarthria from raw speech},
  author = {Juliette Millet and Neil Zeghidour},
  journal= {arXiv preprint arXiv:1811.11101},
  year   = {2019}
}

备注

5 pages, 3 figures, submitted to ICASSP