中文

DuTa-VC:一种基于扩散概率模型的时长感知典型到非典型语音转换方法

音频与语音处理 2023-06-21 v1 信号处理

摘要

我们提出一种新颖的典型到非典型语音转换方法(DuTa-VC),其(i)可使用非并行数据训练,(ii)首次引入扩散概率模型,(iii)保留目标说话人身份,(iv)感知目标说话人的音素时长。DuTa-VC 由三部分组成:编码器将源 mel 频谱图转换为时长修正的说话人无关 mel 频谱图,解码器执行反向扩散以生成目标 mel 频谱图,并应用声码器重建波形。在 UASpeech 上的客观评估表明,DuTa-VC 能够捕捉构音障碍语音的严重度特征,保留说话人身份,并作为数据增强显著改善构音障碍语音识别。两位专家言语病理学家的主观评估证实,DuTa-VC 能在合成语音中保留目标说话人的构音障碍严重度与类型。

关键词

引用

@article{arxiv.2306.10588,
  title  = {DuTa-VC: A Duration-aware Typical-to-atypical Voice Conversion Approach with Diffusion Probabilistic Model},
  author = {Helin Wang and Thomas Thebaud and Jesus Villalba and Myra Sydnor and Becky Lammers and Najim Dehak and Laureano Moro-Velazquez},
  journal= {arXiv preprint arXiv:2306.10588},
  year   = {2023}
}