中文

disordered speech recognition 中数据增强技术的研究

声音 2022-01-20 v1 人工智能 机器学习 音频与语音处理

摘要

构音障碍语音识别是一项极具挑战性的任务。语音障碍者潜在的神经运动状况,常合并共存的身体残疾,导致难以收集系统开发所需的大量语音数据。本文研究了一组用于构音障碍语音识别的数据增强技术,包括声道长度扰动(VTLP)、 tempo 扰动和速度扰动。在增强过程中同时利用了正常语音与构音障碍语音。针对原始数据与增强数据中受损说话人之间的差异,采用基于学习隐单元贡献(LHUC)的说话人自适应训练进行建模。最终使用 UASpeech 语料库及基于速度扰动的最佳增强方法所构建的说话人自适应系统,相较无数据增强的基线系统取得了最高 2.92% 绝对(9.3% 相对)词错误率(WER)的降低,并在包含 16 名构音障碍说话人的测试集上获得了 26.37% 的总体 WER。

关键词

引用

@article{arxiv.2201.05562,
  title  = {Investigation of Data Augmentation Techniques for Disordered Speech Recognition},
  author = {Mengzhe Geng and Xurong Xie and Shansong Liu and Jianwei Yu and Shoukang Hu and Xunying Liu and Helen Meng},
  journal= {arXiv preprint arXiv:2201.05562},
  year   = {2022}
}

备注

Proceedings of INTERSPEECH 2020