中文

用于语音转换的节奏建模

音频与语音处理 2023-07-13 v1 机器学习 声音

摘要

语音转换旨在将源语音变换为不同的目标音色。然而,典型的语音转换系统未考虑节奏,而节奏是说话人身份感知中的重要因素。为弥补此差距,我们引入 Urhythmic——一种无需平行数据或文本转写的无监督节奏转换方法。利用自监督表示,我们首先将源音频划分为近似浊音、阻音与静音的片段。随后我们通过估计说话速率或各片段类型的时长分布来建模节奏。最后,我们通过时间拉伸语音片段来匹配目标说话速率或节奏。实验表明,Urhythmic 在音质与韵律方面优于现有无监督方法。代码与检查点:https://github.com/bshall/urhythmic。音频演示页:https://ubisoft-laforge.github.io/speech/urhythmic。

关键词

引用

@article{arxiv.2307.06040,
  title  = {Rhythm Modeling for Voice Conversion},
  author = {Benjamin van Niekerk and Marc-André Carbonneau and Herman Kamper},
  journal= {arXiv preprint arXiv:2307.06040},
  year   = {2023}
}

备注

5 pages, 4 figures, 4 tables, submitted to IEEE Signal Processing Letters