使用带有多任务学习的自监督模型对构音障碍语音进行自动严重度分类
计算与语言
2023-05-01 v3 人工智能
声音
音频与语音处理
摘要
构音障碍语音的自动评估对于持续治疗和康复至关重要。然而,获取非典型语音具有挑战性,常常导致数据稀缺问题。为了解决这个问题,我们提出了一种新颖的构音障碍语音自动严重度评估方法,该方法结合使用了自监督模型和多任务学习。Wav2vec 2.0 XLS-R 被联合训练用于两个不同的任务:严重度分类和辅助自动语音识别 (ASR)。对于基线实验,我们使用了手工制作的声学特征和机器学习分类器,如 SVM、MLP 和 XGBoost。在韩语构音障碍语音 QoLT 数据库上进行的探索表明,我们的模型优于传统的基线方法,F1 分数相对提高了 1.25%。此外,所提出的模型超越了未使用 ASR 头训练的模型,取得了 10.61% 的相对改进。此外,我们通过分析潜在表示和正则化效应,展示了多任务学习如何影响严重度分类性能。
引用
@article{arxiv.2210.15387,
title = {Automatic Severity Classification of Dysarthric speech by using Self-supervised Model with Multi-task Learning},
author = {Eun Jung Yeo and Kwanghee Choi and Sunhee Kim and Minhwa Chung},
journal= {arXiv preprint arXiv:2210.15387},
year = {2023}
}
备注
Accepted to ICASSP 2023