中文

无需特定口音 TTS 前端建模低资源口音

音频与语音处理 2023-01-12 v1 计算与语言 声音

摘要

本工作关注对没有专用文本转语音(TTS)前端(包括字素到音素(G2P)模块)的说话人口音进行建模。先前关于口音建模的工作假定目标口音有音素转录可用,而对于低资源、地区性口音这可能不成立。在我们的工作中,我们提出一种方法:首先通过语音转换将目标口音数据增强得类似于 donor 嗓音,然后在录音与合成数据的组合上训练多说话人多口音 TTS 模型,以生成 donor 嗓音以目标口音说话。在整个流程中,我们使用为同一语言但不同口音开发的 TTS 前端。我们展示了定性与定量分析,所提策略相较于其他生成模型取得了最先进结果。我们的工作表明,低资源口音可用相对较少的数据建模,且无需开发特定口音的 TTS 前端。我们模型转换到多种口音的音频样本可在我们的网页上获取。

关键词

引用

@article{arxiv.2301.04606,
  title  = {Modelling low-resource accents without accent-specific TTS frontend},
  author = {Georgi Tinchev and Marta Czarnowska and Kamil Deja and Kayoko Yanagisawa and Marius Cotescu},
  journal= {arXiv preprint arXiv:2301.04606},
  year   = {2023}
}

备注

The first two authors contributed equally to this work. In Review. Samples available on https://bit.ly/3V52ZrF