中文

时间拉伸在增强构音障碍语音以改善构音障碍语音识别中的有效性

声音 2022-01-14 v1 人工智能 音频与语音处理

摘要

在本文中,我们研究了几种现有的以及一种新的基于生成对抗网络(GAN)的语音转换前沿方法,用于增强构音障碍语音以改善构音障碍语音识别。我们通过对现有方法的关键组件进行严格的消融研究比较,以寻找改善构音障碍语音识别的最有效方案。我们发现,诸如平稳噪声去除和基于声码器的时间拉伸等直接的信号处理方法,在使用音素识别任务衡量时,所取得的构音障碍语音识别结果与使用基于 GAN 的前沿语音转换方法相当。此外,我们提出的将 MaskCycleGAN-VC 与时间拉伸增强相结合的方案,相较于我们的时间拉伸基线,能够改善某些构音障碍说话人的音素识别结果。

关键词

引用

@article{arxiv.2201.04908,
  title  = {The Effectiveness of Time Stretching for Enhancing Dysarthric Speech for Improved Dysarthric Speech Recognition},
  author = {Luke Prananta and Bence Mark Halpern and Siyuan Feng and Odette Scharenborg},
  journal= {arXiv preprint arXiv:2201.04908},
  year   = {2022}
}

备注

Extended version of paper to be submitted to Interspeech 2022. 6 pages, 2 tables