中文

基于 VAE-GAN 的对抗数据增强用于构音障碍语音识别

音频与语音处理 2023-03-21 v2 声音

摘要

自动识别构音障碍语音至今仍是一项极具挑战性的任务。潜在的神经运动状况往往伴有共存的身体残疾,导致难以收集用于 ASR 系统开发所需的大量受损语音。本文提出新颖的基于变分自编码器生成对抗网络(VAE-GAN)的个性化构音障碍语音增强方法,其同时学习编码、生成并判别合成的受损语音。分别导出潜在特征以学习构音障碍语音特征与音素上下文表示。还引入了自监督预训练的 Wav2vec 2.0 嵌入特征。在 UASpeech 语料库上进行的实验表明,所提出的对抗数据增强方法在使用训练的混合 TDNN 与端到端 Conformer 系统时,始终优于基线速度扰动与非 VAE 的 GAN 增强方法。经 LHUC 说话人自适应后,采用基于 VAE-GAN 增强的最佳系统在 16 名构音障碍说话人的 UASpeech 测试集上取得了 27.78% 的总体词错率(WER),并在“极低”可懂度的说话人子集上取得了已发表的最低 WER 57.31%。

关键词

引用

@article{arxiv.2211.01646,
  title  = {Adversarial Data Augmentation Using VAE-GAN for Disordered Speech Recognition},
  author = {Zengrui Jin and Xurong Xie and Mengzhe Geng and Tianzi Wang and Shujie Hu and Jiajun Deng and Guinan Li and Xunying Liu},
  journal= {arXiv preprint arXiv:2211.01646},
  year   = {2023}
}

备注

Submitted to ICASSP 2023