基于语音识别的特征提取用于增强弯低语音的自动严重程度分类
声音
2024-12-06 v1 人工智能
音频与语音处理
摘要
由于当前临床评估的主观性,针对弯低语音的自动严重程度评估需求日益增长。深度神经网络模型在机器学习模型中表现更好,但缺乏用户友好的可解释性。机器学习模型在特征层面提供可解释结果,但性能相对较低。当前的机器学习模型从原始波形中提取各种特征来预测严重程度。然而,现有方法未涵盖临床评估中使用的全部弯低特征。为弥合这一差距,我们提出一种最小化信息损失的特征提取方法。我们引入ASR转录作为一种新型特征提取来源。我们针对弯低语音微调ASR模型,然后使用该模型对弯低语音进行转录并提取词语段边界信息。这使我们能够捕获更细致的发音和更广泛的韵律特征。这些特征显示出比现有特征更好的严重程�预测性能:平衡准确率为83.72%。
引用
@article{arxiv.2412.03784,
title = {Speech Recognition-based Feature Extraction for Enhanced Automatic Severity Classification in Dysarthric Speech},
author = {Yerin Choi and Jeehyun Lee and Myoung-Wan Koo},
journal= {arXiv preprint arXiv:2412.03784},
year = {2024}
}
备注
Accepted to SLT 2024