探索自监督预训练 ASR 模型用于构音障碍与老年语音识别
声音
2023-06-23 v2 人工智能
音频与语音处理
摘要
由于难以大量采集此类数据, disordered 与老年语音的自动识别至今仍是一项极具挑战性的任务。本文探讨了一系列将领域自适应 SSL 预训练模型集成到 TDNN 与 Conformer ASR 系统中以用于构音障碍与老年语音识别的方法:a) 标准声学前端与领域自适应 wav2vec2.0 语音表示之间的输入特征融合;b) 分别仅使用标准声学特征及附加 wav2vec2.0 特征训练的 TDNN 系统的帧级联合解码;c) 涉及 TDNN/Conformer 系统输出由领域自适应 wav2vec2.0 模型重打分的多遍解码。此外,领域自适应 wav2vec2.0 表示被用于声学到发音(A2A)逆变换以构建多模态构音障碍与老年语音识别系统。在 UASpeech 构音障碍语料库与 DementiaBank Pitt 老年语音语料库上的实验表明,集成领域自适应 wav2vec2.0 模型的 TDNN 与 Conformer ASR 系统分别在两项任务上以统计显著的 WER 绝对降低 8.22% 与 3.43%(相对降低 26.71% 与 15.88%)持续优于独立的 wav2vec2.0 模型。在 16 名构音障碍说话人的 UASpeech 测试集与 DementiaBank Pitt 测试集上分别取得了已发表最低的 WER 22.56%(极低可懂度上 52.53%,未见过词上 39.09%)与 18.17%。
引用
@article{arxiv.2302.14564,
title = {Exploring Self-supervised Pre-trained ASR Models For Dysarthric and Elderly Speech Recognition},
author = {Shujie Hu and Xurong Xie and Zengrui Jin and Mengzhe Geng and Yi Wang and Mingyu Cui and Jiajun Deng and Xunying Liu and Helen Meng},
journal= {arXiv preprint arXiv:2302.14564},
year = {2023}
}
备注
accepted by ICASSP 2023