中文

探究用于语音增强的基于扩散的条件生成语音模型对构音障碍语音的影响

音频与语音处理 2024-12-19 v1 机器学习 声音

摘要

在本研究中,我们旨在首次探索预训练的条件生成语音模型对在理想/无噪声条件下记录的帕金森病构音障碍语音的影响。考虑一类生成模型,即基于扩散的语音增强,这些模型先前经过训练以学习干净(即在无噪声环境中记录)典型语音信号的分布。因此,我们假设当暴露于构音障碍语音时,它们可能会在增强过程中移除未见过的非典型副语言线索。通过考虑自动构音障碍语音检测任务,在本研究中,我们通过实验表明,在对理想无噪声环境中记录的构音障碍语音数据进行增强过程中,一些声学构音障碍语音线索会丢失。因此,此类预训练模型在构音障碍语音增强的背景下尚不适用,因为它们在处理干净构音障碍语音时会操纵病理语音线索。此外,我们表明,增强模型以残差语音信号形式移除的声学线索,当与原始输入语音信号在特征空间中融合时,可以提供互补的构音障碍线索。

关键词

引用

@article{arxiv.2412.13933,
  title  = {Investigating the Effects of Diffusion-based Conditional Generative Speech Models Used for Speech Enhancement on Dysarthric Speech},
  author = {Joanna Reszka and Parvaneh Janbakhshi and Tilak Purohit and Sadegh Mohammadi},
  journal= {arXiv preprint arXiv:2412.13933},
  year   = {2024}
}

备注

Accepted at ICASSP 2025 Satellite Workshop: Workshop on Speech Pathology Analysis and DEtection (SPADE)