中文

将基础语音识别模型适配于障碍言语:面向德语语音个性化的语义重链方法

计算与语言 2025-06-30 v1 人工智能 声音 音频与语音处理

摘要

由脑瘫或遗传性疾病等状况引起的言语障碍对自动语音识别(ASR)系统构成了重大挑战。尽管近年来取得了诸多进展,但 Whisper 等 ASR 模型在面对非典型言语时仍表现欠佳,原因在于训练数据有限以及非典型言语样本的采集与标注难度较大。在本工作中,我们提出了一种实用且轻量化的 ASR 模型个性化流水线,将词语选择形式化,并通过语义连贯性来扩充一个小型言语障碍数据集。该方法被应用于一名患有结构性言语障碍的儿童的数据,结果显示其在转录质量方面取得了可观的提升,证明了该方法在减少非典型言语模式人群沟通障碍方面的潜力。

关键词

引用

@article{arxiv.2506.21622,
  title  = {Adapting Foundation Speech Recognition Models to Impaired Speech: A Semantic Re-chaining Approach for Personalization of German Speech},
  author = {Niclas Pokel and Pehuén Moure and Roman Boehringer and Yingqiang Gao},
  journal= {arXiv preprint arXiv:2506.21622},
  year   = {2025}
}