中文

Pitchtron:面向基于普通人声音的有声书生成

音频与语音处理 2020-05-22 v1 声音

摘要

本文中,我们探索在相当现实的条件下进行有声书生成的韵律迁移,其中训练数据库为大多来自多位普通人的纯音频,且推理时给定的参考音频来自专业人士且比训练数据库韵律更丰富。具体而言,我们探索迁移韩语方言和情感语音,尽管训练集主要由标准和中性韩语组成。我们发现在此设定下,原始的全局风格标记(global style token)方法会在音高、能量和停顿长度上产生不良故障。为处理该问题,我们提出两种模型,硬Pitchtron和软Pitchtron,并发布我们开发的工具包和语料库。硬Pitchtron将音高作为解码器输入,而软Pitchtron将音高作为韵律编码器输入。我们通过客观和主观测试验证了所提模型的有效性。相对于GST,硬Pitchtron和软Pitchtron的AXY分数分别为2.01和1.14。

关键词

引用

@article{arxiv.2005.10456,
  title  = {Pitchtron: Towards audiobook generation from ordinary people's voices},
  author = {Sunghee Jung and Hoirin Kim},
  journal= {arXiv preprint arXiv:2005.10456},
  year   = {2020}
}