中文

最大化互信息的 Tacotron

音频与语音处理 2019-11-19 v2 计算与语言 机器学习 声音

摘要

端到端语音合成方法已达成接近人类水平的性能。然而与基于 HMM 和基于 NN 的帧对帧回归方法相比,它们易出现某些合成错误,如漏词、重复词以及合成不完整。我们将相对较高的语句错误率归因于条件自回归模型的局部信息偏好,以及模型训练目标的不适定性——该目标主要描述自回归模块的训练状态,却很少描述条件模块的状态。受 InfoGAN 启发,我们提出最大化文本条件与预测声学特征之间的互信息,以增强二者在 CAR 语音合成模型中的依赖关系,从而缓解局部信息偏好问题并降低语句错误率。最大化互信息的训练目标可视为自回归模块与条件模块间依赖关系的度量。实验结果表明,我们的方法能够降低语句错误率。

关键词

引用

@article{arxiv.1909.01145,
  title  = {Maximizing Mutual Information for Tacotron},
  author = {Peng Liu and Xixin Wu and Shiyin Kang and Guangzhi Li and Dan Su and Dong Yu},
  journal= {arXiv preprint arXiv:1909.01145},
  year   = {2019}
}