Singing-Tacotron:用于端到端歌声合成的整体时长控制注意力与动态滤波器
量子物理
2022-08-24 v1 介观与纳米尺度物理
摘要
端到端歌声合成(SVS)因避免预对齐数据而颇具吸引力。然而,歌声与歌词的自动学习对齐难以匹配乐谱中的时长信息,将导致模型不稳定甚至无法合成声音。为自动学习准确对齐信息,本文提出一种名为 Singing-Tacotron 的端到端 SVS 框架。所提框架与 Tacotron 的主要区别在于,语音可由乐谱的时长信息显著控制。首先,我们为 SVS 模型提出一种整体时长控制注意力机制,该机制可控制每个音素的时长。其次,提出一个时长编码器,从乐谱中学习一组整体转移标记,这些标记可帮助注意力机制决定在每个解码步前进到下一音素还是停留。第三,为进一步提升模型稳定性,设计了一种动态滤波器,帮助模型克服噪声干扰并更多关注局部上下文信息。主观与客观评测验证了方法的有效性。此外,探究了整体转移标记的作用与时长控制的效果。实验示例见 https://hairuo55.github.io/SingingTacotron。
引用
@article{arxiv.2202.07906,
title = {Quantum interference of resonance fluorescence from Germanium-vacancy color centers in diamond},
author = {Disheng Chen and Johannes Froech and Shihao Ru and Hongbing Cai and Naizhou Wang and Giorgio Adamo and John Scott and Fuli Li and Nikolay Zheludev and Igor Aharonovich and Wei-bo Gao},
journal= {arXiv preprint arXiv:2202.07906},
year = {2022}
}
备注
5 pages, 4 figures; Supplements 9 pages, 8 figures