中文

DDKtor:交替发音运动性言语自动分析

音频与语音处理 2022-06-30 v1 机器学习 声音

摘要

交替发音运动性(DDK)言语任务要求参与者重复发出音节,常作为言语运动障碍评估的一部分。此类研究依赖人工分析,耗时费力、带有主观性,且只能提供粗粒度的言语画像。本文提出两个深度神经网络模型,可从无标注、无转写的言语中自动切分辅音与元音。两个模型均作用于原始波形,并使用卷积层进行特征提取。第一个模型基于 LSTM 分类器后接全连接层,第二个模型增加了更多卷积层后再接全连接层。模型预测的切分结果用于获取言语速率与音素时长测度。在年轻健康个体数据集上的结果表明,我们的 LSTM 模型优于当前最先进(SOTA)系统,且与训练有素的人工标注者表现相当。此外,在未见过的老年帕金森病个体数据集上评估时,LSTM 模型同样展现出与训练有素人工标注者可比的结果。

关键词

引用

@article{arxiv.2206.14639,
  title  = {DDKtor: Automatic Diadochokinetic Speech Analysis},
  author = {Yael Segal and Kasia Hitczenko and Matthew Goldrick and Adam Buchwald and Angela Roberts and Joseph Keshet},
  journal= {arXiv preprint arXiv:2206.14639},
  year   = {2022}
}

备注

Accepted to Interspeech 2022