香港中文大学构音障碍语音识别系统的最新进展
音频与语音处理
2022-03-01 v2 人工智能
机器学习
声音
摘要
尽管过去几十年自动语音识别(ASR)技术快速发展,但迄今为止 disordered speech(构音障碍等言语障碍语音)的识别仍是一项极具挑战性的任务。言语障碍语音给当前以正常语音为主要目标、数据密集型的深度神经网络(DNN)ASR 技术带来广泛挑战。本文介绍香港中文大学(CUHK)在最大公开可用 UASpeech 构音障碍语音语料库上提升言语障碍语音识别系统性能的最新研究进展。采用了一系列新颖建模技术,包括神经架构搜索、基于谱-时域扰动的的数据增强、基于模型的说话人自适应,以及在视听语音识别(AVSR)系统框架内跨域生成视觉特征,以应对上述挑战。这些技术组合在 UASpeech 测试集 16 名构音障碍说话人上取得了已发表最低的 25.21% 词错误率(WER),较采用 6 路 DNN 系统组合及域外正常语音数据训练系统交叉自适应的 CUHK 2018 构音障碍语音识别系统绝对 WER 降低 5.4%(相对 17.6%)。贝叶斯模型自适应进一步可使用少至 3.06 秒语音对个体构音障碍说话人快速自适应。这些技术的有效性在 CUDYS 粤语构音障碍语音识别任务上得到进一步验证。
引用
@article{arxiv.2201.05845,
title = {Recent Progress in the CUHK Dysarthric Speech Recognition System},
author = {Shansong Liu and Mengzhe Geng and Shoukang Hu and Xurong Xie and Mingyu Cui and Jianwei Yu and Xunying Liu and Helen Meng},
journal= {arXiv preprint arXiv:2201.05845},
year = {2022}
}