中文

面向失语及老年语音识别的结构化说话人缺乏适应基础模型

音频与语音处理 2024-12-30 v1 声音

摘要

语音基础模型 (SFM) 数据驱动的精细调优针对稀缺且多样化的失语及老年语音数据,容易导致数据偏见和对未见说话人的泛化能力差。本文提出了新颖的结构化说话人缺乏适应方法,用于 SSL 预训练的 SFM。通过构建在监督自适应微调阶段中对说话人和语音缺陷不变的 SFM,以减少对训练数据说话人的不必要偏见,作为测试时无监督自适应的更中性和更稳健的起点。说话人身份和语音障碍严重程度,或是由衰老引起的神经认知衰退导致的语音可变性,均使用可组合的独立适应器建模,以覆盖任何已见或未见说话人。实验表明,针对 UASpeech 失语语音和 DementiaBank Pitt 老年语音语料库,结构化说话人缺乏适应的 HuBERT 和 Wav2vec2-conformer 模型持续优于基准 SFM,使用以下方法:a) 无适应器;b) 面向所有说话人共享的全局适应器;或 c) 仅建模说话人或缺陷标签的单一属性适应器,在两个任务中分别实现最高可达 3.01% 和 1.50% 的绝对 WER 降低(分别为 10.86% 和 6.94% 的相对降低)。在 16 位失语说话人的数据集上,本文取得的最低已发布 WER 为 19.45%(在非常低可理解性测试集上为 49.34%,在未见单词测试集上为 33.17%)。

关键词

引用

@article{arxiv.2412.18832,
  title  = {Structured Speaker-Deficiency Adaptation of Foundation Models for Dysarthric and Elderly Speech Recognition},
  author = {Shujie Hu and Xurong Xie and Mengzhe Geng and Jiajun Deng and Zengrui Jin and Tianzi Wang and Mingyu Cui and Guinan Li and Zhaoqing Li and Helen Meng and Xunying Liu},
  journal= {arXiv preprint arXiv:2412.18832},
  year   = {2024}
}