中文

SUSing:用于歌声合成的 SU-net

声音 2022-05-25 v1 音频与语音处理

摘要

歌声合成是一项生成式任务,涉及对歌唱模型的多维控制,包括歌词、音高和时长,并包含歌手的音色以及颤音等演唱技巧。本文中,我们提出了用于歌声合成的 SU-net,名为 SUSing。歌声合成被视为歌词与乐谱及频谱之间的翻译任务。歌词和乐谱信息通过卷积层编码为二维特征表示。该二维特征及其频谱通过 SU-net 网络以自回归方式映射到目标频谱。在 SU-net 内部,采用条纹池化(stripe pooling)方法替代交替的全局池化方法,以学习频谱中的垂直频率关系以及时域上的频率变化。在公开数据集 Kiritan 上的实验结果表明,所提方法能够合成更自然的歌声。

关键词

引用

@article{arxiv.2205.11841,
  title  = {SUSing: SU-net for Singing Voice Synthesis},
  author = {Xulong Zhang and Jianzong Wang and Ning Cheng and Jing Xiao},
  journal= {arXiv preprint arXiv:2205.11841},
  year   = {2022}
}

备注

Accepted by IJCNN2022 (The 2022 International Joint Conference on Neural Networks)