中文

基于考虑发声时序偏差的帧级序列到序列模型的歌声合成

音频与语音处理 2023-02-23 v2 机器学习 声音

摘要

本文提出一种基于帧级序列到序列模型并考虑发声时序偏差的歌声合成(SVS)方法。在SVS中,考虑到实际发声时序与音符起始时序之间存在差异,使歌唱时序与乐谱所表示的时间结构同步至关重要。包括我们此前工作在内的许多SVS系统,基于外部对齐器获得的音素边界将音素级乐谱特征转换为帧级特征,以考虑发声时序偏差。因此,该系统的音质受对齐器精度影响。为缓解此问题,我们引入了一种带有帧级特征的注意力机制。在所提系统中,注意力机制吸收了音素边界中的对齐误差。此外,在没有对齐器时,我们使用基于乐谱的启发式规则定义的伪音素边界对系统进行评估。实验结果表明了所提系统的有效性。

关键词

引用

@article{arxiv.2301.02262,
  title  = {Singing voice synthesis based on frame-level sequence-to-sequence models considering vocal timing deviation},
  author = {Miku Nishihara and Yukiya Hono and Kei Hashimoto and Yoshihiko Nankaku and Keiichi Tokuda},
  journal= {arXiv preprint arXiv:2301.02262},
  year   = {2023}
}

备注

5 pages, 4 figures