DiffDSR:基于潜在扩散模型的构音障碍语音重建
声音
2025-06-03 v1 音频与语音处理
摘要
构音障碍语音重建(DSR)旨在将构音障碍语音转换为可理解的语音,同时保持说话人身份。尽管已取得显著进展,但现有方法在语音可懂度低和说话人相似度差方面仍存在困难。在本研究中,我们引入了一种基于扩散的新型 DSR 系统,该系统利用潜在扩散模型来提升语音重建的质量。我们的模型包括: 用于语音内容编码的语音内容编码器,通过预训练的自监督学习(SSL)语音基础模型进行音素嵌入恢复; 用于通过上下文学习机制实现具有说话人感知的身份保持的说话人身份编码器; 基于恢复的音素嵌入和保持的说话人身份来重建语音的基于扩散的语音生成器。通过在广泛使用的 UASpeech 语料库上进行评估,我们提出的模型在语音可懂度和说话人相似度方面均显示出显著提升。
引用
@article{arxiv.2506.00350,
title = {DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model},
author = {Xueyuan Chen and Dongchao Yang and Wenxuan Wu and Minglin Wu and Jing Xu and Xixin Wu and Zhiyong Wu and Helen Meng},
journal= {arXiv preprint arXiv:2506.00350},
year = {2025}
}
备注
Accepted by Interspeech 2025