中文

面向构音障碍与老年语音识别的基于特征的即时说话人自适应方法

音频与语音处理 2023-05-30 v3 人工智能 机器学习 声音

摘要

构音障碍与老年语音的准确识别至今仍是具有挑战性的任务。由口音或性别导致的说话人级异质性,在与年龄和言语障碍叠加时,在这些说话人之间产生了巨大多样性。说话人级数据的稀缺限制了数据密集型模型自适应方法的实际应用。为此,本文提出两种新颖的数据高效、基于特征的即时(on-the-fly)说话人自适应方法:方差正则化谱基嵌入(SVR)与谱特征驱动的 f-LHUC 变换。在 UASpeech 构音障碍语料库与 DementiaBank Pitt 老年语音语料库上的实验表明,所提即时说话人自适应方法始终优于基线 iVector 自适应的混合 DNN/TDNN 与 E2E Conformer 系统,取得统计显著的绝对词错率(WER)降低 2.48%–2.85%(相对 7.92%–8.06%),并分别优于基于离线模型的自适应 LHUC 方法绝对 1.82%(相对 5.63%)。

关键词

引用

@article{arxiv.2203.14593,
  title  = {On-the-Fly Feature Based Rapid Speaker Adaptation for Dysarthric and Elderly Speech Recognition},
  author = {Mengzhe Geng and Xurong Xie and Rongfeng Su and Jianwei Yu and Zengrui Jin and Tianzi Wang and Shujie Hu and Zi Ye and Helen Meng and Xunying Liu},
  journal= {arXiv preprint arXiv:2203.14593},
  year   = {2023}
}

备注

Accepted to INTERSPEECH 2023