中文

面向失语症和老年语音识别的自监督 ASR 模型与特征

音频与语音处理 2024-07-22 v1 人工智能 声音

摘要

自监督学习(SSL)基于的语音基础模型已被应用于广泛的 ASR 任务。然而,其应用于失语症和老年语音时,通过数据密集型参数微调面临数据稀缺和分布不匹配的挑战。为此,本文探讨了一系列方法,将领域微调的 SSL 预训练模型及其特征集成到 TDNN 和 Conformer ASR 系统中,以用于失语症和老年语音识别。这些方法包括:a) 标准声学前端与领域微调的 SSL 语音表示之间的输入特征融合;b) 在仅使用标准声学特征和额外加入领域微调 SSL 特征的 TDNN 系统之间进行帧级联合解码;c) 利用领域微调的预训练 ASR 模型对 TDNN/Conformer 系统输出进行 rescoring 的多 pass 解码。此外,使用微调的 SSL 语音特征用于声学到关节 Articulatory(A2A)逆变,以构建多模态 ASR 系统。实验在四个任务上进行:英语 UASpeech 和 TORGO 失语症语音语料库;以及英语 DementiaBank Pitt 和粤语 JCCOCC MoCA 老年语音数据集。通过集成领域适应的 HuBERT、wav2vec2-conformer 或多语言 XLSR 模型及其特征构建的 TDNN 系统在四个任务中均优于独立的微调 SSL 预训练模型。这些系统在四个任务中分别实现了 6.53%、1.90%、2.04% 和 7.97% 的绝对 WER 或 CER 降低(分别为 24.10%、23.84%、10.14% 和 31.39% 的相对降低)。此外,使用 DementiaBank Pitt 老年语音识别输出也一致获得了阿尔茨海默病检测准确率的提升。

关键词

引用

@article{arxiv.2407.13782,
  title  = {Self-supervised ASR Models and Features For Dysarthric and Elderly Speech Recognition},
  author = {Shujie Hu and Xurong Xie and Mengzhe Geng and Zengrui Jin and Jiajun Deng and Guinan Li and Yi Wang and Mingyu Cui and Tianzi Wang and Helen Meng and Xunying Liu},
  journal= {arXiv preprint arXiv:2407.13782},
  year   = {2024}
}

备注

IEEE/ACM Transactions on Audio, Speech, and Language Processing