基于变分自编码器的变异性编码用于构音障碍语音识别
音频与语音处理
2024-06-17 v2 声音
摘要
由于声学变异性及可用数据有限,构音障碍语音识别是一项具有挑战性的任务。构音障碍说话人的多样状况导致了声学变异性,使得该变异性难以被精确建模。本文提出一种基于变分自编码器(VAE)的变异性编码器(VAEVE),以显式编码此类构音障碍语音的变异性。VAEVE 利用音素信息和低维潜变量来重建输入声学特征,从而迫使潜变量编码与音素无关的变异性。采用随机梯度变分贝叶斯算法对生成变异性编码的分布进行建模,这些编码进一步用作 DNN 声学建模的辅助特征。在 UASpeech 语料库上的实验结果表明,基于 VAEVE 的变异性编码与学习隐单元贡献(LHUC)说话人自适应具有互补效果。使用变异性编码的系统始终优于不使用它们的可比基线系统,并且在“极低可懂度”水平的构音障碍语音上绝对词错误率(WER)降低高达 2.2%,在条件多样或不确定的“混合”类型构音障碍语音上降低高达 2%。
引用
@article{arxiv.2201.09422,
title = {Variational Auto-Encoder Based Variability Encoding for Dysarthric Speech Recognition},
author = {Xurong Xie and Rukiye Ruzi and Xunying Liu and Lan Wang},
journal= {arXiv preprint arXiv:2201.09422},
year = {2024}
}
备注
Published in Interspeech 2021, 4808-4812