中文

用于即时构音障碍与老年说话人自适应的同质说话人特征

声音 2024-07-10 v1 人工智能 人机交互 机器学习 音频与语音处理

摘要

将数据密集型自动语音识别(ASR)技术应用于构音障碍和老年人语音,面临着其与健康和非老化语音不匹配、数据稀缺以及说话人级别差异大的挑战。为此,本文提出了两种新颖的数据高效方法,以学习同质的构音障碍和老年说话人级别特征,用于 DNN/TDNN 和 Conformer ASR 模型的快速即时测试时自适应。这些方法包括:1)说话人级别方差正则化谱基嵌入(VR-SBE)特征,利用特殊的正则化项在自适应中增强说话人特征的同质性;2)以 VR-SBE 特征为条件的基于特征的学习隐藏单元贡献(f-LHUC)变换。实验在两种语言的四个任务上进行:英语 UASpeech 和 TORGO 构音障碍语音数据集,英语 DementiaBank Pitt 和粤语 JCCOCC MoCA 老年语音语料库。所提出的即时说话人自适应技术始终优于基线 iVector 和 xVector 自适应,词或字符错误率绝对降低最高达 5.32%(相对 18.57%),且优于批处理模式 LHUC 说话人自适应,绝对降低 2.24%(相对 9.20%),同时自适应时的实时因子比 xVector 最高加快 33.6 倍。在与当前 ASR 技术(包括 UASpeech 上的 SSL 预训练系统)的对比中,证明了所提自适应方法的有效性,其中我们的最佳系统产生了 23.33% 的 SOTA 词错误率。分析表明,VR-SBE 特征和 f-LHUC 变换对测试时自适应中的说话人级别数据量不敏感。T-SNE 可视化显示,它们比基线 iVector、xVector 和批处理模式 LHUC 变换具有更强的说话人级别同质性。

关键词

引用

@article{arxiv.2407.06310,
  title  = {Homogeneous Speaker Features for On-the-Fly Dysarthric and Elderly Speaker Adaptation},
  author = {Mengzhe Geng and Xurong Xie and Jiajun Deng and Zengrui Jin and Guinan Li and Tianzi Wang and Shujie Hu and Zhaoqing Li and Helen Meng and Xunying Liu},
  journal= {arXiv preprint arXiv:2407.06310},
  year   = {2024}
}

备注

In submission to IEEE/ACM Transactions on Audio, Speech, and Language Processing