中文

J-MAC:用于语音合成的日语多说话人有声书语料库

声音 2022-01-27 v1 音频与语音处理

摘要

在本文中,我们构建了一个名为“J-MAC”的日语有声书语音语料库,用于语音合成研究。随着朗读式语音合成的成功,研究目标正转向利用复杂上下文的任务。有声书语音合成是一个很好的例子,它需要跨句子、表现力等。与朗读式语音不同,有声书语音中说话人特定的表现力也成为上下文的一部分。为推动该研究,我们提出了一种从专业朗读者录制的有声书中构建语料库的方法。从大量有声书及其文本中,我们的方法能够在无语言依赖的情况下自动提取并精炼数据。具体而言,我们使用声伴分离提取干净数据,使用连接时序分类粗略对齐文本与音频,并使用语音活动检测来精炼对齐结果。J-MAC已在我们的项目页面开源。我们还进行了有声书语音合成评估,结果对有声书语音合成提供了见解。

关键词

引用

@article{arxiv.2201.10896,
  title  = {J-MAC: Japanese multi-speaker audiobook corpus for speech synthesis},
  author = {Shinnosuke Takamichi and Wataru Nakata and Naoko Tanji and Hiroshi Saruwatari},
  journal= {arXiv preprint arXiv:2201.10896},
  year   = {2022}
}