中文

基于语音识别的特征提取用于增强弯低语音的自动严重程度分类

声音 2024-12-06 v1 人工智能 音频与语音处理

摘要

由于当前临床评估的主观性,针对弯低语音的自动严重程度评估需求日益增长。深度神经网络模型在机器学习模型中表现更好,但缺乏用户友好的可解释性。机器学习模型在特征层面提供可解释结果,但性能相对较低。当前的机器学习模型从原始波形中提取各种特征来预测严重程度。然而,现有方法未涵盖临床评估中使用的全部弯低特征。为弥合这一差距,我们提出一种最小化信息损失的特征提取方法。我们引入ASR转录作为一种新型特征提取来源。我们针对弯低语音微调ASR模型,然后使用该模型对弯低语音进行转录并提取词语段边界信息。这使我们能够捕获更细致的发音和更广泛的韵律特征。这些特征显示出比现有特征更好的严重程�预测性能:平衡准确率为83.72%。

关键词

引用

@article{arxiv.2412.03784,
  title  = {Speech Recognition-based Feature Extraction for Enhanced Automatic Severity Classification in Dysarthric Speech},
  author = {Yerin Choi and Jeehyun Lee and Myoung-Wan Koo},
  journal= {arXiv preprint arXiv:2412.03784},
  year   = {2024}
}

备注

Accepted to SLT 2024