中文

使用增强重建损失从构音障碍语音中创建个性化合成语音

音频与语音处理 2024-01-09 v1 声音

摘要

本研究关于为头颈癌幸存者创建个性化合成语音。特别关注舌癌患者,其语音可能表现出严重的构音障碍。我们的目标是恢复合成语音中的正常构音,同时在音色和说话风格方面最大程度地保留目标说话人的个体特征。这被表述为一个从噪声标签中学习的任务。我们建议在常用的语音重建损失中增加两个额外项。第一项构成正则化损失,以减轻训练语音中扭曲构音的影响。第二项是一致性损失,旨在鼓励生成的语音中具有正确的构音。这些额外的损失项是从原始语音和生成语音的帧级构音得分中获得的,这些得分是使用单独训练的音素分类器推导出来的。在真实舌癌患者身上的实验结果证实,合成语音实现了与无障碍自然语音相当的构音质量,同时有效保持了目标说话人的个体特征。音频样本可在 https://myspeechproject.github.io/ArticulationRepair/ 获取。

关键词

引用

@article{arxiv.2401.03816,
  title  = {Creating Personalized Synthetic Voices from Articulation Impaired Speech Using Augmented Reconstruction Loss},
  author = {Yusheng Tian and Jingyu Li and Tan Lee},
  journal= {arXiv preprint arXiv:2401.03816},
  year   = {2024}
}

备注

Accepted to ICASSP 2024