中文

构音障碍语音转换中保持说话人身份的两阶段范式初步研究

声音 2021-06-04 v1 计算与语言 音频与语音处理

摘要

我们提出了一种在构音障碍语音转换(DVC)中保持说话人身份的新范式。统计语音转换可大幅改善构音障碍语音的质量,但由于几乎无法采集构音障碍患者的正常语音,以往工作未能恢复患者的个体特征。有鉴于此,我们提出了一种新颖的两阶段 DVC 方法,其高度灵活,无需患者的正常语音。首先,一个强大的并行序列到序列模型将输入的构音障碍语音转换为参考说话人的正常语音作为中间产物,随后一个基于变分自编码器实现的非并行逐帧语音转换模型将参考语音的说话人身份转换回患者身份,同时被认为能够保持增强后的质量。我们研究了若干设计选项。实验评估结果证明了该方法在提升构音障碍语音质量的同时保持说话人身份的潜力。

关键词

引用

@article{arxiv.2106.01415,
  title  = {A Preliminary Study of a Two-Stage Paradigm for Preserving Speaker Identity in Dysarthric Voice Conversion},
  author = {Wen-Chin Huang and Kazuhiro Kobayashi and Yu-Huai Peng and Ching-Feng Liu and Yu Tsao and Hsin-Min Wang and Tomoki Toda},
  journal= {arXiv preprint arXiv:2106.01415},
  year   = {2021}
}

备注

Accepted to Interspeech 2021. 5 pages, 3 figures, 1 table