中文

基于大规模语音识别的构音障碍语音中不恰当停顿检测

计算与语言 2024-03-01 v1 声音 音频与语音处理

摘要

构音障碍是中风患者中常见的问题,严重影响语音可懂度。不恰当停顿是严重程度评估和言语语言治疗的关键指标。我们提出扩展大规模语音识别模型,用于检测构音障碍语音中的不恰当停顿。为此,我们提出了任务设计、标注策略以及带有不恰当停顿预测层的语音识别模型。首先,我们将停顿检测视为语音识别任务,利用自动语音识别(ASR)模型将语音转换为带有停顿标签的文本。根据新设计的任务,我们在文本层面标注停顿位置及其恰当性。我们与言语语言病理学家合作建立标注标准,以确保高质量的标注数据。最后,我们在 ASR 模型基础上扩展了不恰当停顿预测层,实现端到端的不恰当停顿检测。此外,我们提出了一种针对该任务的评估指标,用于独立于 ASR 性能评估不恰当停顿检测。实验表明,所提方法在检测构音障碍语音中的不恰当停顿方面优于基线方法(不恰当停顿错误率为 14.47%)。

关键词

引用

@article{arxiv.2402.18923,
  title  = {Inappropriate Pause Detection In Dysarthric Speech Using Large-Scale Speech Recognition},
  author = {Jeehyun Lee and Yerin Choi and Tae-Jin Song and Myoung-Wan Koo},
  journal= {arXiv preprint arXiv:2402.18923},
  year   = {2024}
}

备注

Accepted to ICASSP 2024