在数据稀缺背景下利用ASR驱动的Wav2Vec2探索病理语音质量评估
音频与语音处理
2024-04-01 v1 计算与语言
机器学习
声音
摘要
自动语音质量评估作为传统感知临床评估的替代或支持,已引起更多关注。然而,迄今为止大多数研究仅在简单任务(如二分类)上取得良好结果,这主要是由于数据稀缺。为了应对这一挑战,当前的工作倾向于将患者的音频文件分割成许多样本以扩充数据集。然而,这种方法存在局限性,因为它将整体音频分数间接关联到各个片段。本文介绍了一种新方法,其中系统在音频级别学习,而不是在片段级别,尽管数据稀缺。本文提出使用预训练的Wav2Vec2架构作为SSL和ASR特征提取器进行语音评估。在HNC数据集上进行的实验表明,我们的ASR驱动方法与其他方法相比建立了新的基线,仅使用95个训练样本,在可懂度和严重程度评分预测上分别获得了平均MSE=0.73和MSE=1.15。这表明基于ASR的Wav2Vec2模型带来了最佳结果,并可能表明ASR与语音质量评估之间存在强相关性。我们还测量了其在可变片段持续时间和语音内容上的能力,探索了影响其决策的因素。
引用
@article{arxiv.2403.20184,
title = {Exploring Pathological Speech Quality Assessment with ASR-Powered Wav2Vec2 in Data-Scarce Context},
author = {Tuan Nguyen and Corinne Fredouille and Alain Ghio and Mathieu Balaguer and Virginie Woisard},
journal= {arXiv preprint arXiv:2403.20184},
year = {2024}
}
备注
Accepted at LREC-COLING 2024