面向失语患者语音的扩散模型语音增强的客观与主观评估
音频与语音处理
2025-08-26 v1 声音
摘要
失语患者语音由于其高变异性和较低的可理解性,构成了自动语音识别(ASR)系统的重大挑战。本文探讨了使用扩散模型进行失语患者语音增强的方法,该方法基于以下假设:利用基于扩散的语音增强可将失语患者语音的分布移动到典型语音的分布附近,从而可能改善失语患者语音识别性能。我们评估了两种基于扩散的和一种基于信号处理的语音增强算法对失语患者语音可理解性和语音质量的影响。我们对两种典型语音和失语患者语音应用语音增强,并使用 Whisper-Turbo 评估 ASR 性能,以及对原始和增强后的失语患者语音进行主观和客观语音质量评估。我们还对 Whisper-Turbo进行微调,以评估其对识别性能的影响。
关键词
引用
@article{arxiv.2508.17980,
title = {Objective and Subjective Evaluation of Diffusion-Based Speech Enhancement for Dysarthric Speech},
author = {Dimme de Groot and Tanvina Patel and Devendra Kayande and Odette Scharenborg and Zhengjun Yue},
journal= {arXiv preprint arXiv:2508.17980},
year = {2025}
}
备注
Accepted to Interspeech 2025