中文

变分低秩适应用于个性化障碍语音识别

音频与语音处理 2026-03-17 v2 人工智能

摘要

由先天性障碍(如脑瘫、唐氏综合征或阿佩尔综合征)以及获得性脑损伤(如中风、创伤事故或肿瘤)引起的言语障碍,对自动语音识别(ASR)系统构成了重大挑战。尽管近期取得了进展,但最先进的 ASR 模型如 Whisper 仍因训练数据有限和声学高变异性而难以处理非规范语音。此外,收集和标注非规范语音负担沉重:许多受影响个体说话费力,而费力的标注通常需要熟悉说话者的照护者。本工作引入了一种基于贝叶斯低秩适应的新型 ASR 个性化方法,用于数据高效微调。我们在英语 UA-Speech 数据集和新收集的德语语音数据集 BF-Sprache(来自一名具有结构语音障碍的儿童)上验证了我们的方法。该数据集和方法旨在反映低资源环境中的挑战,包括言语障碍个体。我们的方法显著改善了障碍语音的 ASR 准确率,同时保持了数据和标注效率,为包容性 ASR 提供了实用路径。

关键词

引用

@article{arxiv.2509.20397,
  title  = {Variational Low-Rank Adaptation for Personalized Impaired Speech Recognition},
  author = {Niclas Pokel and Pehuén Moure and Roman Boehringer and Shih-Chii Liu and Yingqiang Gao},
  journal= {arXiv preprint arXiv:2509.20397},
  year   = {2026}
}