中文

Reinforce-Aligner:面向鲁棒端到端语音合成的强化对齐搜索

音频与语音处理 2021-06-08 v1

摘要

语音合成(TTS)是从文本或音素输入生成合成语音的过程。传统TTS模型包含多个处理步骤并需要外部对齐器,以提供音素到帧序列的注意力对齐。由于每增加一个步骤都会使复杂度上升、效率下降,现代合成流程对具有高效内部对齐器的端到端TTS的需求日益增长。本工作中,我们提出一种端到端文本到波形网络,其采用基于强化学习的时长搜索新方法。我们所提出的生成器为前馈结构,对齐器训练智能体通过接收所采取动作的主动反馈以最大化累积奖励,从而做出最优时长预测。我们证明,训练所得智能体生成的音素到帧序列的准确对齐提升了合成音频的保真度与自然度。实验结果也显示了我们的模型相较于其他具有内部与外部对齐器的最先进TTS模型的优越性。

关键词

引用

@article{arxiv.2106.02830,
  title  = {Reinforce-Aligner: Reinforcement Alignment Search for Robust End-to-End Text-to-Speech},
  author = {Hyunseung Chung and Sang-Hoon Lee and Seong-Whan Lee},
  journal= {arXiv preprint arXiv:2106.02830},
  year   = {2021}
}

备注

Accepted in INTERSPEECH 2021