中文

Fast DCTTS:高效深度卷积文本到语音

音频与语音处理 2021-04-02 v1 人工智能 机器学习

摘要

我们提出一种端到端语音合成器 Fast DCTTS,可在单个 CPU 线程上实时合成语音。所提模型由精心调优的轻量网络构成,该网络通过应用多种网络缩减与保真度提升技术而设计。此外,我们提出一种新颖的组高速公路激活(group highway activation),可在计算效率与门控机制的正则化效应之间折衷。同时,我们引入称为弹性梅尔倒谱失真(EMCD)的新指标,以衡量输出梅尔谱图的保真度。实验中,我们分析了加速技术对速度与语音质量的影响。相比基线模型,所提模型在仅用 1.76% 计算量与 2.75% 参数量下,平均意见得分(MOS)从 2.62 提升至 2.74。单个 CPU 线程上的速度提升了 7.45 倍,足以在不使用 GPU 的情况下实时生成梅尔谱图。

关键词

引用

@article{arxiv.2104.00624,
  title  = {Fast DCTTS: Efficient Deep Convolutional Text-to-Speech},
  author = {Minsu Kang and Jihyun Lee and Simin Kim and Injung Kim},
  journal= {arXiv preprint arXiv:2104.00624},
  year   = {2021}
}

备注

5 pages, 1 figure, to be published in IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) 2021