中文

面向构音障碍语音识别的对抗数据增强

音频与语音处理 2021-08-03 v1 声音

摘要

迄今为止,构音障碍语音的自动识别仍是一项极具挑战性的任务。潜在的神经运动状况往往伴有共病性身体残疾,导致难以收集语音识别(ASR)系统开发所需的大量受损语音。为此,数据增强技术在当前的构音障碍语音识别系统中起着至关重要的作用。与现有仅修改语速或谱轮廓整体形状的数据增强技术不同,本文在数据增强过程中使用深度卷积生成对抗网络(DCGAN)对构音障碍语音与正常语音之间细粒度的谱-时频差异进行建模,将正常语音谱修改为更接近构音障碍语音的谱。在 UASpeech 语料库上的实验表明,所提出的对抗数据增强方法在最先进的混合 DNN 系统上始终优于使用 tempo 或速度扰动的基线增强方法。相较于不使用数据增强的基线系统,总体词错误率(WER)最高降低 3.05%(相对 9.7%)。采用最佳对抗增强方法的最终学习隐单元贡献(LHUC)说话人自适应系统在 16 名构音障碍说话人的 UASpeech 测试集上取得了 25.89% 的总体词错误率。

关键词

引用

@article{arxiv.2108.00899,
  title  = {Adversarial Data Augmentation for Disordered Speech Recognition},
  author = {Zengrui Jin and Mengzhe Geng and Xurong Xie and Jianwei Yu and Shansong Liu and Xunying Liu and Helen Meng},
  journal= {arXiv preprint arXiv:2108.00899},
  year   = {2021}
}

备注

5 pages, 3 figures, INTERSPEECH 2021