中文

提升表现力神经文本到语音的音频质量

音频与语音处理 2021-08-16 v1 人工智能

摘要

人工语音合成在自然度方面已取得巨大飞跃,近期的文本到语音(TTS)系统能够生成与人类录音质量相近的语音。然而,并非所有说话风格都易于建模:高度表现力的声音即便对近期TTS架构仍具挑战性,因为生成音频的表现力与其信号质量之间似乎存在权衡。本文提出一组可在不使用额外数据的情况下提升高度表现力声音信号质量的技术。所提技术包括:训练期间调节自回归循环的粒度;在声学建模中使用生成对抗网络(Generative Adversarial Networks, GAN);以及在声学模型和神经声码器中均使用变分自编码器(Variational Auto-Encoders)。我们表明,当组合使用时,这些技术以MUSHRA分数计,将一个表现力名人声音在感知自然度上缩小了基线系统与录音之间差距的39%。

关键词

引用

@article{arxiv.2108.06270,
  title  = {Enhancing audio quality for expressive Neural Text-to-Speech},
  author = {Abdelhamid Ezzerg and Adam Gabrys and Bartosz Putrycz and Daniel Korzekwa and Daniel Saez-Trigueros and David McHardy and Kamil Pokora and Jakub Lachowicz and Jaime Lorenzo-Trueba and Viacheslav Klimkov},
  journal= {arXiv preprint arXiv:2108.06270},
  year   = {2021}
}

备注

6 pages, 4 figures, 2 tables, SSW 2021