中文

基于前馈 Transformer 的序列到序列歌声合成

声音 2020-02-21 v2 机器学习 音频与语音处理

摘要

我们提出了一种序列到序列歌声合成器,其避免了需要使用预先对齐的音素与声学特征训练数据。与更常见的基于内容的注意力机制结合自回归解码器的方法不同,我们采用了一种适用于前馈合成的不同机制。鉴于歌唱中的音素时序受乐谱高度约束,我们借助简单的时长模型推导出近似初始对齐。随后,使用基于 Transformer 模型前馈变体的解码器,一系列自注意力与卷积层对初始对齐结果进行细化以得到目标声学特征。该方法的优势包括更快的推理速度,以及避免了影响由教师强制训练的自回归模型的曝光偏差问题。我们将该模型与自回归基线进行了有效性比较,并评估了自注意力的重要性以及时长模型准确性的重要性。

关键词

引用

@article{arxiv.1910.09989,
  title  = {Sequence-to-sequence Singing Synthesis Using the Feed-forward Transformer},
  author = {Merlijn Blaauw and Jordi Bonada},
  journal= {arXiv preprint arXiv:1910.09989},
  year   = {2020}
}

备注

5 pages, 1 figure, accepted at ICASSP 2020