中文

基于谱时深度特征的说话人自适应用于构音障碍与老年语音识别

音频与语音处理 2022-03-18 v3 人工智能 机器学习 声音 定量方法

摘要

尽管近几十年来针对正常语音的自动语音识别(ASR)技术快速发展,但迄今为止准确识别构音障碍与老年语音仍是极具挑战性的任务。正常语音中常见的异质性来源(包括口音或性别)进一步叠加年龄与语音病理严重程度的差异,造成说话人之间的巨大多样性。为此,说话人自适应技术在为此类用户的ASR系统个性化中起着关键作用。受构音障碍、老年与正常语音之间在谱时层面系统性表现为发音不准、音量与清晰度下降、语速较慢及不流利增加的差异启发,本文提出新颖的谱时子空间基深度嵌入特征,其利用SVD语音频谱分解导出,以促进基于辅助特征的最先进混合DNN/TDNN与端到端Conformer语音识别系统的说话人自适应。实验在四项任务上开展:英语UASpeech与TORGO构音障碍语音语料库;英语DementiaBank Pitt与粤语JCCOCC MoCA老年语音数据集。所提出的谱时深度特征自适应系统相较基线i-Vector与xVector自适应,词错误率(WER)绝对降低达2.63%(相对降低8.63%)。在进一步应用基于模型的学习隐单元贡献(LHUC)说话人自适应后,一致的性能提升得以保持。采用所提谱基嵌入特征的最佳说话人自适应系统在UASpeech的16名构音障碍说话人测试集上取得了已发表最低的25.05% WER。

关键词

引用

@article{arxiv.2202.10290,
  title  = {Speaker Adaptation Using Spectro-Temporal Deep Features for Dysarthric and Elderly Speech Recognition},
  author = {Mengzhe Geng and Xurong Xie and Zi Ye and Tianzi Wang and Guinan Li and Shujie Hu and Xunying Liu and Helen Meng},
  journal= {arXiv preprint arXiv:2202.10290},
  year   = {2022}
}

备注

In submission to IEEE/ACM Transactions on Audio Speech and Language Processing