基于编码器-解码器架构的端到端歌声合成实证研究
声音
2021-08-29 v1 机器学习
音频与语音处理
摘要
随着神经网络架构与语音处理模型的快速发展,基于神经网络的歌声合成正成为数字音乐制作的前沿技术。本工作中,为探索如何提升歌声合成的质量与效率,我们采用编码器-解码器神经模型与若干声码器实现歌声合成。我们通过实验证明,模型可利用带音高信息、歌词与节拍的人声数据进行训练,且训练所得模型能生成接近真实人声、平滑清晰自然的歌声。由于模型以端到端方式工作,它们使得非领域专家用户能够通过编排音高、歌词与节拍直接生成歌声。
引用
@article{arxiv.2108.03008,
title = {An Empirical Study on End-to-End Singing Voice Synthesis with Encoder-Decoder Architectures},
author = {Dengfeng Ke and Yuxing Lu and Xudong Liu and Yanyan Xu and Jing Sun and Cheng-Hao Cai},
journal= {arXiv preprint arXiv:2108.03008},
year = {2021}
}
备注
27 pages, 4 figures, 5 tables