中文

用于病理语音 ASR 的发音特征

计算与语言 2018-07-31 v1

摘要

在本工作中,我们研究发音特征与声学特征的联合使用以进行病理语音的自动语音识别(ASR)。尽管为构音障碍患者构建说话人与文本无关的 ASR 系统已有长期努力,但最先进系统在此类语音上的性能仍显著低于正常语音。性能较差的最显著原因是病理语音的高变异性,其以由不同病因所致发音损伤引起的谱时偏离为特征。为应对此高变异,我们提出使用利用发音信息及声学属性的语音表示。一个专门的声学模型,即融合特征图卷积神经网络(fCNN),在荷兰语和弗拉芒语病理语音语料库上训练并测试,该网络对声学特征进行频率卷积、对发音特征进行时间卷积。基于 fCNN 的使用联合特征的 ASR 系统性能在若干训练场景下与常规 CNN 和时频卷积网络(TFCNN)等其他神经网络架构进行比较。

关键词

引用

@article{arxiv.1807.10948,
  title  = {Articulatory Features for ASR of Pathological Speech},
  author = {Emre Yılmaz and Vikramjit Mitra and Chris Bartels and Horacio Franco},
  journal= {arXiv preprint arXiv:1807.10948},
  year   = {2018}
}

备注

Accepted for publication at Interspeech 2018