言语障碍严重程度在构音障碍语音识别中的应用
音频与语音处理
2023-05-19 v1 人工智能
机器学习
声音
摘要
构音障碍语音识别的一个关键挑战是由说话人身份相关因素(如性别)和言语障碍严重程度共同导致的说话人级多样性。以往解决该问题的研究大多仅关注说话人身份。为此,本文提出一组新技术以在构音障碍语音识别中同时使用严重程度与说话人身份:a) 融入严重程度预测误差的多任务训练;b) 说话人-严重程度感知的辅助特征自适应;c) 分别以说话人身份和严重程度为条件的结构化 LHUC 变换。在 UASpeech 上的实验表明,将额外的言语障碍严重程度引入最先进的混合 DNN、E2E Conformer 和预训练 Wav2vec 2.0 ASR 系统,取得了统计显著的词错率(WER)降低,最高达 4.78%(相对 14.03%)。使用最佳系统,在 UASpeech 上获得了已发表最低的 WER 17.82%(极低可懂度下为 51.25%)。
引用
@article{arxiv.2305.10659,
title = {Use of Speech Impairment Severity for Dysarthric Speech Recognition},
author = {Mengzhe Geng and Zengrui Jin and Tianzi Wang and Shujie Hu and Jiajun Deng and Mingyu Cui and Guinan Li and Jianwei Yu and Xurong Xie and Xunying Liu},
journal= {arXiv preprint arXiv:2305.10659},
year = {2023}
}
备注
Accepted to INTERSPEECH2023